腾讯云语音识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-asr。
技能介绍
具体问题
在开发中,语音转文字是常见需求,例如会议记录、语音交互或内容分析。传统方案可能面临识别准确率不高、多语种支持有限、实时性差或成本过高等问题。腾讯云语音识别(ASR)旨在解决这些痛点,提供高精度、低延迟的语音转文字服务,支持从短句到长录音的全场景覆盖。
核心能力与关键步骤
腾讯云语音识别提供多种识别模式,根据音频特征选择:
- 一句话识别:适用于短音频(≤60秒,≤3MB),使用
sentence_recognize.py脚本,快速返回结果。 - 录音文件识别极速版:适用于中等时长音频(≤2小时,≤100MB),使用
flash_recognize.py,平衡速度与资源。 - 录音文件识别异步任务:适用于大文件或公网 URL,使用
file_recognize.py,支持异步处理。
关键步骤包括:
- 音频探测:先运行
inspect_audio.py分析音频格式、时长、大小等,为后续路由提供依据。 - 凭证自检:使用
self_check.py验证腾讯云 SecretId、SecretKey 等凭证,确保服务可用性。 - 引擎选择:根据音频语种(如普通话、中英混说、粤语、英语等)从引擎选择表中选取合适引擎,例如中英混说优先用
16k_zh-PY(一句话识别)或16k_zh_en(极速版)。 - 路由决策:结合音频大小和 URL/本地路径,选择识别方式;公网 URL 默认走
file_recognize.py rec,避免不必要的本地处理。
适用边界与注意点
- 禁止替代:当脚本失败时,必须返回错误信息,不得用模型猜测转写内容,确保数据可靠性。
- 密钥安全:在群聊中禁止直接发送 SecretId、SecretKey;私聊需先提醒“密钥会经过 LLM,存在泄漏风险”。
- 环境依赖:需要 FFmpeg/ffprobe 进行音频处理,脚本支持通过
ensure_ffmpeg.py自动安装,失败后再向用户求助。 - 单次任务优先:避免为一次性识别修改系统配置(如
~/.bashrc),使用当前命令注入即可。 - 极速版限制:如果自检中一句话识别和录音文件识别通过但极速版失败,提示“常见于国际站账号,或国内站账号在海外访问时受限”,不作为绝对结论。
- 默认少打断:除非用户必须补充凭证或明确要求,否则不要无意义确认,保持流程顺畅。
使用场景
- 将包含中英文讨论的会议录音转写为文字文档,便于后续整理和分发。
- 识别用户上传的粤语语音反馈,提取内容以改进产品本地化策略。
- 批量转换播客音频文件,利用异步识别生成文本用于内容分析。
- 实时处理短视频中的中英混说语音,生成字幕以提升视频可访问性。
适合人员
- 每周需要处理多份会议录音并整理成文字纪要的项目经理。
- 负责产品本地化、需要分析方言用户反馈的本地化工程师。
- 制作播客内容、希望将音频转为文字以优化SEO的独立内容创作者。
- 运营短视频账号、需要为中英混说视频添加字幕的社交媒体经理。