Agent Skills
返回列表
ASR 与 TTS 语音配置助手

ASR 与 TTS 语音配置助手

AI Agent 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_5777f071/voice-process-helper。

技能介绍

解决什么问题

在飞书、Telegram、企业微信等聊天通道接入大模型后,语音消息常会卡住流程:语音文件没有转成文本,文本回复也缺少自然语音输出。这个技能把 TTS 和 ASR 的配置拆成可检查、可选择、可安装的步骤,避免直接回复“无法处理语音”。

技能如何工作

它先根据用户意图路由到 TTS 语音回复 或 ASR 语音识别:

  • TTS:检查状态为 ready、partial、not_configured,再给出 edge-tts-universal 或腾讯云语音合成选项,安装后要求重启 Gateway。
  • ASR:识别音频附件或明确转写请求,探测机器资源,再选择本地 Whisper 或腾讯云 ASR,并按模型体积给出建议。

核心原则是先展示成本、隐私、延迟和部署差异,等用户明确选择后再执行。

边界与注意

该技能不是语音识别模型本身,而是配置与部署助手;所有语音能力依赖底层插件、凭证和服务端重启。免费方案适合离线或低成本场景,云服务需要密钥并受额度限制。若收到的是文档里的 JSON 片段或示例代码,不应触发 ASR。

使用场景

  • 在飞书机器人接入大模型后,需要把用户发来的语音消息稳定转成文本再继续对话。
  • 给 Telegram 聊天机器人配置语音回复,让指定回答自动变成语音气泡。
  • 在资源有限服务器上部署 ASR,需要比较本地 Whisper 和云识别的体积与成本。
  • 安装 TTS 和 ASR 后,需要按规则重启 Gateway 并验证 /new 新会话可用。

适合人员

  • 维护飞书或 Telegram 机器人、希望补齐语音输入输出的后端工程师。
  • 部署聊天 Gateway、需要管理 TTS/ASR 凭证与重启流程的平台工程师。
  • 评估离线 Whisper 与云 ASR 成本、为客服助手选择语音识别方案的架构师。
  • 把大模型接入企业微信或 QQ 通道、要适配原生语音消息格式的集成工程师。