Agent Skills
返回列表
Vidu 音频生成

Vidu 音频生成

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @vidu/vidu-speech-generate-2。

技能介绍

解决什么问题

当文本内容需要快速变成可发布的音频时,手动挑音色、调语速和情绪成本不低。Vidu 音频生成 把 Vidu 的 TTS 与声音复刻能力包装成可对话式调用的技能,适合短视频、教程、多语言内容和临时音色复刻。

技能如何工作

它根据内容场景自动推荐 Voice ID,例如商务、科普、萌系、英文/日文/韩文等。核心流程包括:

  • TTS 语音合成:输入文本后生成同步音频 URL,支持 speed、volume、pitch、emotion 参数。
  • 停顿控制:用标记控制秒级停顿,便于口播节奏。
  • 声音复刻:基于 10 秒到 5 分钟清晰样本生成临时音色,7 天内调用 TTS 才会保留。
  • 多域名路由:中文默认走 api.vidu.cn,其他语言走 api.vidu.com。

长文本超过 30 字符时需要使用 --text-file 参数,避免命令行传参溢出。

适用边界

它不是通用音频编辑器,也不能保证复刻音色完全免版权或永久可用。复刻样本必须清晰、无背景噪音;API Key、Voice ID、音频时长和任务状态都会影响结果。输出重点是可直接访问的音频链接。

使用场景

  • 为小红书口播稿快速生成女声配音,并调整停顿和情绪。
  • 把英文产品介绍读成自然语音,输出可直接下载的音频链接。
  • 用一段清晰人声样本复刻临时音色,再做后续 TTS 播报。
  • 将中文科普长文本按语速、音量和音调参数合成播客式讲解。

适合人员

  • 运营:需要把脚本批量变成短视频口播音频。
  • 内容创作者:需要按场景选择可爱、商务或治愈音色。
  • 本地化编辑:需要为英文、日文、韩文文案生成对应语音。
  • 语音产品工程师:需要调用 Vidu TTS 与声音复刻接口做集成。