Agent Skills
返回列表
小米 MiMo V2-TTS 语音合成

小米 MiMo V2-TTS 语音合成

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_512254e3/mimo-tts。

技能介绍

解决的问题

当工程师需要在本地脚本、CI 任务或工具链中生成配音,而不是在网页控制台手工操作时,核心问题是:如何稳定调用 MiMo V2-TTS,把文本转换为可落盘或可流式消费的音频。这个技能把调用封装为命令行参数,减少手写 API 请求和音频格式处理的重复工作。

工作方式

  • 输入与输出:通过 --text 传入合成文本,用 --output 指定文件路径;默认输出 wav,流式模式使用 pcm16。
  • 音色与风格:--voice 可选择 mimo_default、default_zh、default_en;合成文本会自动放在 assistant 角色消息中,风格标签需放在文本开头,唱歌场景需按说明使用 唱歌 标签。
  • 运行要求:必须设置 MIMO_API_KEY;单次文本建议控制在 2000 字以内,长文本分段处理,避免超时。

适用边界

它适合需要脚本化生成中文、英文或默认音色音频的场景,尤其是把 TTS 输出接入后续流程。若需要复杂多人对话编排、实时低延迟交互,或依赖尚未在文档中列出的风格标签,需要额外验证。

使用场景

  • 在脚本中把播客文案合成为中文女声 WAV,再导入剪辑软件做后期处理。
  • 为自动化新闻播报脚本生成英文女声 WAV,并保存到指定输出目录。
  • 在本地工具链里把长文本分段调用 TTS,输出多段 WAV 供后续拼接。
  • 为实时语音原型做链路验证,使用流式模式和 pcm16 格式消费音频。

适合人员

  • 需要把脚本或 CI 中的文本转成 WAV 的后端工程师
  • 要生成中文女声和英文女声演示素材的播客制作者
  • 在做语音助手原型、需要 pcm16 流式输出的前端或嵌入式工程师
  • 负责自动化配音素材生产、需要按音色和风格生成音频的内容运营