Vidu 声音克隆
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f95f21b8/dlazy-vidu-audio-clone。
技能介绍
解决什么问题
在语音生成工作流中,常常需要保留某个人声特征,同时让模型读取新的文本。vidu audio clone 面向这个场景:基于 dLazy 的 Vidu 接口完成声音克隆,并生成新的文本朗读音频。它不是本地推理工具,而是调用托管 API 的薄客户端,适合把声音样本、提示词和生成任务接入命令行或 Agent 流程。
技能如何工作
技能通过 dlazy CLI 发起请求。用户提供音频文件或相关路径后,本地文件会被上传到 dLazy 的媒体存储,供后端模型读取;提示词和参数发送到 api.dlazy.com 进行推理;生成的音频 URL 由 files.dlazy.com 返回。若使用异步任务,返回的 outputs 可能为空,并附带 generateId 与 status,需要继续轮询任务状态。
适用边界
该技能依赖有效的 dLazy API key,且请求会进入云端 SaaS 链路。资料中未描述本地私有化部署、批量并发上限或服务端数据保留策略,因此涉及敏感声音样本时,应先确认授权与合规。报错方面,unauthorized、insufficient_balance、缺少参数、本地文件读取失败或安全策略拒绝都需要分别处理,不能仅按普通生成失败重试。
使用场景
- 在配音工作流中,已有参考人声,需要生成不同台词的朗读音频,调用 Vidu 声音克隆。
- 在 Agent 流程里,用户提交语音文件和待读文本,技能上传文件并请求 dLazy 生成新音频。
- 在 CLI 任务中,异步调用生成接口,拿到 generateId 后轮询状态并取回 files.dlazy.com 音频链接。
- 在发布前质检,检查 unauthorized、insufficient_balance、缺少参数和本地文件读取失败等错误。
适合人员
- 需要把参考人声转成新台词朗读音频的配音工程师。
- 在 Agent 中接入云端语音生成并处理异步任务的自动化工程师。
- 要检查 API key、余额和文件上传失败的 CLI 工具维护者。
- 需要生成品牌口播或提示词试听音频的音频产品经理。