配音与旁白工作室
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/voiceover-narration-studio。
技能介绍
在语音合成项目中,开发者和创作者常面临一个核心问题:任务分散且场景各异。短社交口播、长篇有声书、播客节目、多语言适配或品牌音色克隆,各有专用工具和流程。手动在不同工具间切换、管理参数,不仅效率低,还容易出错,尤其当需求混合或跨会话时。
具体问题:碎片化的语音制作
用户可能只是想生成一条推广口播,但后续可能扩展为多语言版本,或需要创建品牌专属音色。如果没有统一协调,就需要分别调用 short-form-voiceover-audio、ai-multilingual-dubbing 或 voice-cloning-studio 等多个技能,并手动维护状态和参数。这带来了路由判断、声音验证、费用计算和结果跟踪的复杂性。
工作室如何工作:路由与标准流水线
配音与旁白工作室作为协调层,解决这个问题。它不是直接执行合成的引擎,而是根据用户意图智能路由,并执行标准的语音合成子任务。其核心能力包括:
- 意图路由与分流:入口处分析请求。例如,明确的“短社交口播”会路由至
short-form-voiceover-audio;“有声书”路由至ai-audiobook-narration。未覆盖的混合或长篇任务则由本工作室直接处理,并建立制作台账。 - 标准声音与模型验证:无论路由到何处,每次操作都会调用
beatra.voices.list实时验证声音状态(voice_id必须为ready)。使用model: "auto"时,会根据声音的compatible_models和语言支持情况,从beatra.models.list返回的候选池中实时构建可选模型。 - 制作卡与付费确认:所有付费操作(如
beatra.speech.synthesize或beatra.voices.clone)都基于一张制作卡。卡片包含已确认文本、声音、模型、语言、控制参数和费用估算。用户明确“生成”即视为批准。克隆操作有独立入场卡,需用户确认余额。 - 带台账的顺序交付:长篇或多语言任务采用台账管理。先交付用户确认的试制片段,再交付剩余部分。音频结果(包含
audio.url、duration_seconds等)按批准顺序返回,已接受的片段保持不变。
整个流程通过随包的 scripts/mcp_client.py 脚本与 Beatra 后端交互,不直接使用 REST API。
注意事项与适用边界
- 纯语音边界:本工作室只负责语音生成和克隆子任务。它不制作完整视频,不执行口型同步,不转录,也不编辑现有音频波形。相邻的视频制作等结果会交给其他工作流。
- 授权与合规:声音仿声必须获得授权。克隆声音前,必须确认说话者身份或授权,并使用
scripts/mcp_client.py upload上传样本。未授权操作会被拒绝。 - 技术约束:所有 Beatra 操作必须通过指定的
mcp_client.py脚本,以 JSON 格式输入。它拒绝配置宿主连接器或使用 REST/OpenAPI 降级方案。客户端会自动检查更新,但更新失败不影响当前命令执行。 - 费用与恢复:克隆是付费操作,通常需要充值(入门套餐 ¥29/11,000 分)。合成根据字符数计费(中文字符算2个)。请求失败时,使用本地保存的
client_request_id进行恢复,但字段变化需新请求。
使用场景
- 为电商平台的多支短视频广告批量制作配音。需要根据中文脚本生成单条或不同口音的英语、日语旁白,并管理每次制作的费用和声音模型。
- 将一本已完结的中文小说制作成英语有声书。需要按章节顺序生成长篇旁白,确保全书使用同一授权音色,并维护制作台账以跟踪进度。
- 将一期个人播客节目本地化。已有中文文稿,需要生成西班牙语和法语版本,且希望测试不同主持人的声音模型以选择最佳效果。
- 为公司产品创建一个永久的品牌声音库。需要克隆指定配音员的声音样本,生成可复用的音色 ID,供所有未来市场宣传视频调用。
适合人员
- 需要为海外社媒营销视频制作多语言配音的品牌经理。他们手头有中文脚本,但缺乏快速生成高质量、多语种旁白并控制预算的工具。
- 独立播客制作人,正计划将历史系列节目制作成有声读物。他们需要一种方法,能按顺序录制大量章节,同时保持声音风格统一并处理授权问题。
- 负责国际版应用的本地化工程师。他们需要为应用内语音提示(如导航、帮助文本)批量生成多种语言的音频文件,要求发音准确且易于版本管理。
- 市场营销部门的音频内容负责人。他们需要为不同产品线快速测试和选定合适的画外音,并确保声音资产在团队内可复用且授权合规。