AI多语言配音
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/ai-multilingual-dubbing。
技能介绍
多语言旁白音频制作的工程化挑战
在为多市场内容(如课程、广告、产品演示)制作旁白音频时,工程师常面临以下痛点:
- 语言区域与脚本管理混乱:需要同时处理数十种语言版本,脚本状态、术语、发音说明、时长目标散落各处,难以系统跟踪。
- 声音选择与试听成本高:跨语言的声音兼容性未知,传统流程需反复沟通,为每个语言单独试听新声音效率低下。
- 付费流程不透明:语音合成按请求计费,在确认最终范围前,难以预估总成本并避免意外开销。
- 任务状态与恢复复杂:生成任务可能耗时较长,涉及异步操作、超时重试和结果汇总,手动管理易出错。
核心工作流与能力
该技能旨在通过结构化流程解决上述问题,其核心是一个 segment × locale 制作矩阵。工作流遵循以下关键步骤:
1. 矩阵驱动的脚本准备
- 首先将用户提供的源内容(文本或音视频转录)划分为自然片段(如一个广告单元或课程章节),绝不切断句子。
- 为每个片段(
segment)与目标语言区域(locale)构建矩阵单元格,强制记录BCP-47标签、已确认文案、受保护术语、声音、演绎方向、格式与时长目标。这确保了信息的原子化与可追溯性。
2. 声音发现与试制策略
- 技能复用对话中已接受的声音。若不可用,则调用
beatra.voices.list进行筛选,并推荐 2-3 个候选。 - 严格遵循先试后付原则:仅使用免费的试听 URL 进行选择,不为选声产生合成费用。
- 对于多语言范围,每种语言会选择一个高风险代表性片段(包含数字、术语、行动号召)进行试制。默认使用
model: "auto"和语速 1.0。
3. 范围确认与受控执行
- 在发起任何
beatra.speech.synthesize付费操作前,会以易读的矩阵形式展示完整的付费范围,明确每个单元格将产生一次付费渲染。 - 用户一次确认整个矩阵后,技能为每个单元格创建唯一的
client_request_id,并提交任务。任务状态通过beatra.tasks.get轮询,遵守deadline_at超时,并主动处理恢复,而非无限等待。 - 所有 MCP 操作强制通过随包的
scripts/mcp_client.py执行,避免依赖宿主连接器。
4. 结果交付与验证
- 任务成功后,按语言区域分组交付音频 URL、资产 ID、MIME 类型、实际采样率与持续时间等事实数据。
- 技能不宣称完成翻译、字幕、口型同步或精确时长匹配。如果用户要求修改,仅对受影响的单元格重新取得确认并重做,保持已接受部分不变。
适用场景与重要限制
此技能专注于从文本到语音的单向生成与管理,适用于:
- 已定稿多语言文案的批量音频制作。
- 需要严格成本控制与状态跟踪的配音项目。
必须注意的关键边界:
- 输入必须是文本:若源为视频/音频,需先获取转录文本,并始终将其视为待确认草稿。
- 范围外工作不涵盖:不提供文案翻译、口型同步、音视频编辑或基于画面的精确时长匹配。
- 计费与状态依赖:付费操作前需明确矩阵确认;任务执行是异步的,需遵循其轮询与恢复机制。
- 自动更新:技能可能静默检查官方更新,仅替换自身文件,不影响当前执行中的用户命令。
使用场景
- 为面向北美、欧洲、东南亚三地发布的产品介绍视频制作多语言旁白,需统一管理不同语言版本的脚本、发音术语和最终音频交付。
- 为一套包含10章内容的在线编程课程生成英语、日语和西班牙语旁白,每章脚本需独立控制语速、声音,并确保术语发音一致。
- 为一场全球市场数字广告活动,根据各市场最终确认的营销文案,批量生成对应语言的音频广告素材,并严格跟踪每条音频的生成状态与成本。
- 在已有音频素材需新增多语言版本时,通过脚本化流程,集中处理语音合成请求、任务轮询和结果归档,替代手动逐个提交和查询。
适合人员
- 负责跨国产品内容本地化的工程师,需要结构化管理数十种语言的音频制作状态、脚本确认和资源交付。
- 内容制作团队的项目协调人,需要跟踪多语言音频资产从脚本定稿、声音试听到最终合成的全生命周期进度。
- 媒体制作人或独立内容创作者,需为视频课程或广告批量、可控地生成多语种旁白,同时明确管理每一步的付费操作。
- 技术项目经理,需要自动化处理涉及外部语音合成API的长时任务,包括提交、状态轮询、超时恢复和结果汇总。