Agent Skills
返回列表
AI多语言配音

AI多语言配音

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/ai-multilingual-dubbing。

技能介绍

多语言旁白音频制作的工程化挑战

在为多市场内容(如课程、广告、产品演示)制作旁白音频时,工程师常面临以下痛点:

  • 语言区域与脚本管理混乱:需要同时处理数十种语言版本,脚本状态、术语、发音说明、时长目标散落各处,难以系统跟踪。
  • 声音选择与试听成本高:跨语言的声音兼容性未知,传统流程需反复沟通,为每个语言单独试听新声音效率低下。
  • 付费流程不透明:语音合成按请求计费,在确认最终范围前,难以预估总成本并避免意外开销。
  • 任务状态与恢复复杂:生成任务可能耗时较长,涉及异步操作、超时重试和结果汇总,手动管理易出错。

核心工作流与能力

该技能旨在通过结构化流程解决上述问题,其核心是一个 segment × locale 制作矩阵。工作流遵循以下关键步骤:

1. 矩阵驱动的脚本准备

  • 首先将用户提供的源内容(文本或音视频转录)划分为自然片段(如一个广告单元或课程章节),绝不切断句子。
  • 为每个片段(segment)与目标语言区域(locale)构建矩阵单元格,强制记录 BCP-47 标签、已确认文案、受保护术语、声音、演绎方向、格式与时长目标。这确保了信息的原子化与可追溯性。

2. 声音发现与试制策略

  • 技能复用对话中已接受的声音。若不可用,则调用 beatra.voices.list 进行筛选,并推荐 2-3 个候选。
  • 严格遵循先试后付原则:仅使用免费的试听 URL 进行选择,不为选声产生合成费用。
  • 对于多语言范围,每种语言会选择一个高风险代表性片段(包含数字、术语、行动号召)进行试制。默认使用 model: "auto"语速 1.0

3. 范围确认与受控执行

  • 在发起任何 beatra.speech.synthesize 付费操作前,会以易读的矩阵形式展示完整的付费范围,明确每个单元格将产生一次付费渲染。
  • 用户一次确认整个矩阵后,技能为每个单元格创建唯一的 client_request_id,并提交任务。任务状态通过 beatra.tasks.get 轮询,遵守 deadline_at 超时,并主动处理恢复,而非无限等待。
  • 所有 MCP 操作强制通过随包的 scripts/mcp_client.py 执行,避免依赖宿主连接器。

4. 结果交付与验证

  • 任务成功后,按语言区域分组交付音频 URL、资产 ID、MIME 类型、实际采样率与持续时间等事实数据。
  • 技能不宣称完成翻译、字幕、口型同步或精确时长匹配。如果用户要求修改,仅对受影响的单元格重新取得确认并重做,保持已接受部分不变。

适用场景与重要限制

此技能专注于从文本到语音的单向生成与管理,适用于:

  • 已定稿多语言文案的批量音频制作。
  • 需要严格成本控制与状态跟踪的配音项目。

必须注意的关键边界:

  • 输入必须是文本:若源为视频/音频,需先获取转录文本,并始终将其视为待确认草稿。
  • 范围外工作不涵盖:不提供文案翻译、口型同步、音视频编辑或基于画面的精确时长匹配。
  • 计费与状态依赖:付费操作前需明确矩阵确认;任务执行是异步的,需遵循其轮询与恢复机制。
  • 自动更新:技能可能静默检查官方更新,仅替换自身文件,不影响当前执行中的用户命令。

使用场景

  • 为面向北美、欧洲、东南亚三地发布的产品介绍视频制作多语言旁白,需统一管理不同语言版本的脚本、发音术语和最终音频交付。
  • 为一套包含10章内容的在线编程课程生成英语、日语和西班牙语旁白,每章脚本需独立控制语速、声音,并确保术语发音一致。
  • 为一场全球市场数字广告活动,根据各市场最终确认的营销文案,批量生成对应语言的音频广告素材,并严格跟踪每条音频的生成状态与成本。
  • 在已有音频素材需新增多语言版本时,通过脚本化流程,集中处理语音合成请求、任务轮询和结果归档,替代手动逐个提交和查询。

适合人员

  • 负责跨国产品内容本地化的工程师,需要结构化管理数十种语言的音频制作状态、脚本确认和资源交付。
  • 内容制作团队的项目协调人,需要跟踪多语言音频资产从脚本定稿、声音试听到最终合成的全生命周期进度。
  • 媒体制作人或独立内容创作者,需为视频课程或广告批量、可控地生成多语种旁白,同时明确管理每一步的付费操作。
  • 技术项目经理,需要自动化处理涉及外部语音合成API的长时任务,包括提交、状态轮询、超时恢复和结果汇总。