Agent Skills
返回列表
MiMo 语音合成与识别

MiMo 语音合成与识别

开发编程 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_168d274d/mimofreetts。

技能介绍

问题

语音合成在本地脚本、内容流水线或有声内容生成中,常遇到三类麻烦:TTS API 只返回裸能力,长文本容易超时;无 Key 或限流时没有降级;输出格式、数字口语化、批量文件处理需要自己拼接。MiMo TTS & ASR 面向这些工程缝隙,把模型调用包成可复用的命令行工作流。

工作方式

核心能力围绕 scripts/tts.py 与 scripts/asr.py:

  • 三合一 TTS:预置音色、自然语言音色设计、参考音频克隆统一入口;
  • 工程兜底:无 MIMO_API_KEY 时切换 edge-tts,并对 429、502/503、超时做重试与随机延迟;
  • 长文本处理:按标点切段、批量读取文件、监听目录新增 .txt;
  • 输出保障:自动识别 wav/mp3/ogg,检查空文件与过短音频,支持缓存、降噪、音量归一化。

边界

ASR 云端能力仍为预留,本地识别通常需要 GPU 与 CUDA。当前三款 TTS 模型限时免费,正式计费后建议保留 --cache。该技能依赖 ffmpeg/ffprobe 与 python3,适合作为内容批处理、有声演示和语音原型工具,不适合替代官方 API 的鉴权、配额或合规控制。

使用场景

  • 监听目录里新增的 .txt 台词文件,并自动合成试听音频。
  • 在 CI 里没有 MiMo Key 时,用 edge-tts 免费通道生成中文或英文播报音频。
  • 把长文案按标点切段,批量合成多段语音并检测空文件或过短输出。
  • 根据文本情绪推荐冰糖或 Mia,并按输出后缀生成 wav/mp3 文件。

适合人员

  • 每周要把新增台词文件转成试听音频的有声内容制作工程师。
  • 想在无 GPU 环境先用 MiMo API 或 edge-tts 验证语音效果的 Python 开发者。
  • 需要把长文案拆段合成并自动排查空文件的自动化工程师。
  • 希望用同一入口切换预置、描述设计和参考克隆的语音应用开发者。