可灵声音克隆
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f95f21b8/dlazy-kling-audio-clone。
技能介绍
要解决的问题
当需要用特定音色朗读自定义文本时,普通 TTS 往往只能给出通用声音,无法稳定还原参考音频里的音色、语感和说话风格。这个技能面向配音、角色语音、批量文本转语音等场景,把“上传参考音频 + 提供提示词或参数”封装成一次可执行、可轮询的生成任务,适合嵌入已有内容生产或自动化流程。
工作方式与关键能力
- 该技能是 dLazy hosted API 的 thin client,核心调用是
dlazy kling-audio-clone。 - 所有请求都需要 dLazy API Key,可通过 CLI 配置,也可以用
DLAZY_API_KEY环境变量传入。 - 传入本地音频路径时,文件会被上传到 dLazy media storage,模型读取后生成语音,返回结果通常托管在
files.dlazy.com。 - 支持异步模式:使用
--no-wait后会返回generateId和任务状态,可用dlazy status --wait轮询生成结果。 - 错误处理覆盖常见链路问题,包括
unauthorized、缺少必填参数、本地文件读取失败、余额不足、服务端错误,以及异步任务因安全策略失败等。
适用边界与注意
- 生成能力依赖 dLazy 账号、API Key、余额和服务条款,不是完全本地推理方案。
- API Key 与 dLazy organization 绑定,可以在控制台轮换或撤销。
- 如果返回
insufficient_balance,需要提示用户处理余额;如果返回unauthorized,需要先完成 API Key 配置。 - 最终语音效果仍受参考音频质量、模型能力和提示词约束,不应假设它能无限逼近原说话人。
使用场景
- 配音制作时上传角色参考音频,生成统一音色与语感的旁白文本。
- 批量处理文本时调用 dLazy API,将多段文案转成相同参考声音。
- 自动化流程中提交异步语音生成任务,并用任务 ID 轮询最终音频。
- 调试 API 调用时区分认证失败、余额不足、参数缺失等服务端错误。
适合人员
- 需要把固定角色音色复用到多条文案里的配音工程师
- 在自动化内容流水线中接入云端语音生成 API 的后端开发
- 需要批量生成角色语音并跟踪异步任务状态的产品技术负责人
- 调试 dLazy API Key、余额与文件上传问题的应用工程师