ASR 与 TTS 语音配置助手
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_5777f071/voice-process-helper。
技能介绍
解决什么问题
在飞书、Telegram、企业微信等聊天通道接入大模型后,语音消息常会卡住流程:语音文件没有转成文本,文本回复也缺少自然语音输出。这个技能把 TTS 和 ASR 的配置拆成可检查、可选择、可安装的步骤,避免直接回复“无法处理语音”。
技能如何工作
它先根据用户意图路由到 TTS 语音回复 或 ASR 语音识别:
- TTS:检查状态为
ready、partial、not_configured,再给出edge-tts-universal或腾讯云语音合成选项,安装后要求重启Gateway。 - ASR:识别音频附件或明确转写请求,探测机器资源,再选择本地
Whisper或腾讯云 ASR,并按模型体积给出建议。
核心原则是先展示成本、隐私、延迟和部署差异,等用户明确选择后再执行。
边界与注意
该技能不是语音识别模型本身,而是配置与部署助手;所有语音能力依赖底层插件、凭证和服务端重启。免费方案适合离线或低成本场景,云服务需要密钥并受额度限制。若收到的是文档里的 JSON 片段或示例代码,不应触发 ASR。
使用场景
- 在飞书机器人接入大模型后,需要把用户发来的语音消息稳定转成文本再继续对话。
- 给 Telegram 聊天机器人配置语音回复,让指定回答自动变成语音气泡。
- 在资源有限服务器上部署 ASR,需要比较本地 Whisper 和云识别的体积与成本。
- 安装 TTS 和 ASR 后,需要按规则重启 Gateway 并验证 /new 新会话可用。
适合人员
- 维护飞书或 Telegram 机器人、希望补齐语音输入输出的后端工程师。
- 部署聊天 Gateway、需要管理 TTS/ASR 凭证与重启流程的平台工程师。
- 评估离线 Whisper 与云 ASR 成本、为客服助手选择语音识别方案的架构师。
- 把大模型接入企业微信或 QQ 通道、要适配原生语音消息格式的集成工程师。