MiMo V2.5 语音合成
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a5827f21/mimo-v2-5-tts。
技能介绍
问题
TTS 调用常常只解决“把文本念出来”:同一句内容要不同语气、方言、唱腔或更自然的停顿,往往还要反复手写提示词、拼接口和调试参数。mimo-v2.5-tts 针对这类中文/英文语音生成场景,把模型选择、风格控制和音频输出整理成脚本化流程。
工作方式
它封装 MiMo V2.5 系列三个入口:
mimo-v2.5-tts:预置音色,支持中英文与唱歌mimo-v2.5-tts-voicedesign:用一段音色描述生成新声音mimo-v2.5-tts-voiceclone:用mp3/wav样本复刻声音
自然语言控制通过 --context 传入,可描述角色、场景和表演指导,形成“导演模式”。文本内还能插入风格或音频标签,例如 (唱歌)、(东北话)、[停顿],用于句内语气、情绪和呼吸变化。长文本通常建议一次性生成,超过约 2500 字再按段落合成并用 ffmpeg 拼接。需要发到飞书时,可调用语音发送脚本完成转码、上传和 audio 消息投递。
注意点
预置音色需要明确 Voice ID;音色克隆样本 Base64 后不超过 10 MB,且只支持 mp3/wav;TTS 输出存在随机性,关键片段建议多生成几版再挑选。
使用场景
- 为中文播客准备开场白,用预置音色和情绪标签生成带停顿、轻笑的音频。
- 把产品介绍文案拆成多角色旁白,用音色设计生成不同主播声线并试听。
- 将英文小说章节合成为有声片段,用导演模式控制语速、气息和重音。
- 把生成的 WAV 转成飞书语音条发给测试群,确认音频消息不是普通附件。
适合人员
- 负责播客制作的音频编辑,需要快速生成多情绪中文旁白并统一语气。
- 做产品演示的前端工程师,要把文案变成带停顿、重音的语音 Demo。
- 做有声内容的独立创作者,想用文本描述定制独特音色并复用到其他文本。
- 交付飞书消息的自动化工程师,需要把 TTS 音频发成语音条而不是附件。