MiMo 语音合成与识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_168d274d/mimofreetts。
技能介绍
问题
语音合成在本地脚本、内容流水线或有声内容生成中,常遇到三类麻烦:TTS API 只返回裸能力,长文本容易超时;无 Key 或限流时没有降级;输出格式、数字口语化、批量文件处理需要自己拼接。MiMo TTS & ASR 面向这些工程缝隙,把模型调用包成可复用的命令行工作流。
工作方式
核心能力围绕 scripts/tts.py 与 scripts/asr.py:
- 三合一 TTS:预置音色、自然语言音色设计、参考音频克隆统一入口;
- 工程兜底:无
MIMO_API_KEY时切换edge-tts,并对429、502/503、超时做重试与随机延迟; - 长文本处理:按标点切段、批量读取文件、监听目录新增
.txt; - 输出保障:自动识别
wav/mp3/ogg,检查空文件与过短音频,支持缓存、降噪、音量归一化。
边界
ASR 云端能力仍为预留,本地识别通常需要 GPU 与 CUDA。当前三款 TTS 模型限时免费,正式计费后建议保留 --cache。该技能依赖 ffmpeg/ffprobe 与 python3,适合作为内容批处理、有声演示和语音原型工具,不适合替代官方 API 的鉴权、配额或合规控制。
使用场景
- 监听目录里新增的 .txt 台词文件,并自动合成试听音频。
- 在 CI 里没有 MiMo Key 时,用 edge-tts 免费通道生成中文或英文播报音频。
- 把长文案按标点切段,批量合成多段语音并检测空文件或过短输出。
- 根据文本情绪推荐冰糖或 Mia,并按输出后缀生成 wav/mp3 文件。
适合人员
- 每周要把新增台词文件转成试听音频的有声内容制作工程师。
- 想在无 GPU 环境先用 MiMo API 或 edge-tts 验证语音效果的 Python 开发者。
- 需要把长文案拆段合成并自动排查空文件的自动化工程师。
- 希望用同一入口切换预置、描述设计和参考克隆的语音应用开发者。