Vidu 音频生成
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @vidu/vidu-speech-generate-2。
技能介绍
解决什么问题
当文本内容需要快速变成可发布的音频时,手动挑音色、调语速和情绪成本不低。Vidu 音频生成 把 Vidu 的 TTS 与声音复刻能力包装成可对话式调用的技能,适合短视频、教程、多语言内容和临时音色复刻。
技能如何工作
它根据内容场景自动推荐 Voice ID,例如商务、科普、萌系、英文/日文/韩文等。核心流程包括:
- TTS 语音合成:输入文本后生成同步音频 URL,支持
speed、volume、pitch、emotion参数。 - 停顿控制:用标记控制秒级停顿,便于口播节奏。
- 声音复刻:基于 10 秒到 5 分钟清晰样本生成临时音色,7 天内调用 TTS 才会保留。
- 多域名路由:中文默认走
api.vidu.cn,其他语言走api.vidu.com。
长文本超过 30 字符时需要使用 --text-file 参数,避免命令行传参溢出。
适用边界
它不是通用音频编辑器,也不能保证复刻音色完全免版权或永久可用。复刻样本必须清晰、无背景噪音;API Key、Voice ID、音频时长和任务状态都会影响结果。输出重点是可直接访问的音频链接。
使用场景
- 为小红书口播稿快速生成女声配音,并调整停顿和情绪。
- 把英文产品介绍读成自然语音,输出可直接下载的音频链接。
- 用一段清晰人声样本复刻临时音色,再做后续 TTS 播报。
- 将中文科普长文本按语速、音量和音调参数合成播客式讲解。
适合人员
- 运营:需要把脚本批量变成短视频口播音频。
- 内容创作者:需要按场景选择可爱、商务或治愈音色。
- 本地化编辑:需要为英文、日文、韩文文案生成对应语音。
- 语音产品工程师:需要调用 Vidu TTS 与声音复刻接口做集成。