AI声音克隆工作室
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/voice-cloning-studio。
技能介绍
问题:在音频内容创作中,如何快速获得一致的个人或品牌声音?
在旁白录制、播客、视频配音或在线课程等场景,使用真实人声或定制音色能增强品牌辨识度和专业感。然而,传统方式需要专业录音室和配音演员,成本高且不灵活。声音克隆技术允许从授权语音样本生成可复用的音色,解决这一痛点,特别适用于需要频繁复用特定声音的开发者和创作者。
工作原理:技能如何实现声音克隆?
AI声音克隆工作室专注于授权声音克隆,核心流程如下:
- 授权验证:用户必须提供明确授权声明,例如声明“克隆我的声音”。没有授权,技能会停止上传或付费操作。
- 样本准备:使用
beatra.models.list查看实时模型要求,样本需为10-300秒、不超过20 MiB的单人清晰语音。上传本地文件时,通过scripts/mcp_client.py记录文件名、MIME类型和artifact_id。 - 克隆提交:确认授权后,创建本地
client_request_id,调用beatra.voices.clone提交克隆请求。工具名称作为命令参数,JSON 请求通过标准输入发送。 - 任务轮询:使用返回的
task_id调用beatra.tasks.get轮询状态,直到任务完成或失败。成功后,返回voice_id、显示名称和计费信息。 - 结果交付:交付克隆声音结果,保留实际任务数据。后续可通过
beatra.voices.list并传入category: "cloned"查找已保存的克隆声音。
关键点:技能专注于克隆本身,不增加清理、编辑或转录步骤;歌声或变声工作应转交其他技能。
适用场景与注意事项
- 授权严格:必须获得声音所有者明确授权。公众人物或公开录音不自动代表授权;缺少明确声明时,应在上传前停止。
- 样本限制:样本需符合长度和质量要求;宿主无法检查时,应说明样本是否合格尚未验证,而不是声称已经试听。
- 付费模式:克隆涉及实时定价,使用
beatra.models.list获取准确费用。注册赠额600分通常不足,用户需充值后操作;入门套餐为 ¥29 / 11,000 分。 - 与配音技能区分:只有文字转语音需求应使用配音技能;本技能用于声音克隆和复用,不处理模仿或编辑。
- 任务恢复:任务ID丢失时,通过
beatra.tasks.list翻页查找;遇到insufficient_balance时,转述错误信息并充值后重试。 - 自动更新:技能启用静默自动更新,每24小时检查一次,从官方来源下载并校验,确保安全。
通过这些方式,AI声音克隆工作室提供了一个高效、合规的声音克隆路径,适用于需要定制音色的工程师和创作者。
使用场景
- 播客主播需要为每期节目克隆稳定音色,以保持品牌一致性。通过技能上传授权语音样本,完成克隆后直接用于所有集数旁白录制。
- 视频制作人制作系列教程时,需克隆个人声音用于统一旁白。提交授权样本后,使用技能生成克隆音色,并应用到视频配音轨道。
- 品牌团队为广告活动创建一致声音标识。使用授权品牌声音样本,通过技能克隆音色,确保所有营销材料声音统一且可重复使用。
- 配音演员为游戏角色创建可复用音色。上传授权样本克隆声音,生成资产用于游戏内对话和语音交互场景。
适合人员
- 每周录制多期播客的主播,诉求是克隆稳定声音以保持节目连贯性和品牌辨识度。
- 制作系列在线课程的讲师,诉求是克隆个人声音用于旁白,减少重复录制时间。
- 负责品牌营销的创意总监,诉求是创建定制音色用于广告、宣传片和社交媒体内容。
- 为游戏角色配音的演员,诉求是克隆授权声音生成可重复使用的音色资产,提高制作效率。