AI短视频配音
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/short-form-voiceover-audio。
技能介绍
需要解决的具体问题
在短视频制作中,将脚本转化为自然流畅的旁白音频面临多重挑战。脚本往往需要调整为适合朗读的格式,同时要匹配平台要求、受众语气和语言读音。传统配音流程涉及声音选择、模型兼容性验证、定价不透明等问题,导致多次试错和效率低下。用户可能需要反复修改脚本并手动测试不同声音,无法快速获得可靠音频。
核心能力与关键步骤
该技能通过 AI 模型自动化配音流程,以制作卡驱动工作,确保每一步可控。
- 确定最小制作要求:复用用户提供的脚本和背景信息,只补充显著改变音频但缺失的选择,如最终脚本、平台用途、受众语气、目标语言(BCP-47 代码)和读音要求。脚本需调整为清晰展示、适合朗读的版本,并在含义变化时取得用户批准。
- 声音和模型选择:调用
beatra.voices.list获取声音候选,基于preview_url和compatible_models推荐。通过beatra.models.list并传入capability: "text_to_speech"验证模型在线状态、语言支持和兼容性。默认使用model: "auto",但需解析所有候选项并确认语言支持。 - 估价与确认:应用
beatra_weighted_characters规则计算加权字符数(汉字权重 2,其他字符 1),结合实时定价信息生成制作卡,显示准确脚本、voice_id、模型、语言、格式、采样率、语速、音量、音高和预计积分。用户批准后,才执行付费操作beatra.speech.synthesize。 - 执行与轮询:使用随包
scripts/mcp_client.py客户端,通过 CLI 参数和 stdin JSON 调用合成 API。为每个批准请求创建不透明client_request_id,立即记录task_id,并使用beatra.tasks.get轮询任务状态直到终态。 - 恢复与防重复:如果任务中断,通过
beatra.tasks.get或beatra.tasks.list按capability和时间窗口查找任务,避免重复生成付费音频。只有传输错误导致原始结果未知时,才可重放相同client_request_id,且 JSON 必须一致。 - 交付事实:任务成功后,返回
task_id、音频 URL、artifact_id、duration_seconds、实际mime_type、采样率等事实。比较时长目标并报告偏差,交付仅为音频文件,不包含视频、字幕或数字人合成。
适用边界与注意点
- 交付范围:音频生成是独立任务,不涉及视频创建、口型同步、发布或声音克隆。对于完整视频,应保留需求作为子任务或转交视频工作流。
- 时长与定价:时长目标仅作为审核参考,不作保证。定价基于加权字符和实时规则,用户需在制作卡中确认。
- 操作约束:所有 Beatra 操作必须通过指定的
scripts/mcp_client.py,不配置其他连接器。付费调用需用户批准,不自动重试或重放。 - 任务管理:只有用户要求取消时才使用
beatra.tasks.cancel。任务恢复基于事实匹配,不声称远程 ID 证明对应关系。 - 更新机制:自动更新在后台静默进行,不影响当前操作,但失败时回滚并继续用户请求。
使用场景
- 短视频博主准备发布新内容,需要将完成的脚本转化为自然流畅的旁白音频,用于剪辑时直接插入视频轨道。
- 营销团队制作产品宣传短视频,需根据脚本生成专业配音,确保声音匹配平台要求(如抖音或YouTube)和受众语气。
- 在线教育机构创建多语言教学短视频,需要将脚本转换为指定语言(如普通话或英语)的旁白,并处理特殊读音。
- 自媒体运营者批量制作系列短视频,需要高效生成一致风格的配音,同时控制成本并避免重复操作。
适合人员
- 短视频内容创作者:每周发布多个视频,需要快速生成风格统一的旁白音频,减少手动配音时间。
- 社交媒体营销专员:负责制作广告短视频,需专业配音提升内容吸引力,同时确保模型和语言兼容。
- 在线教育讲师:制作多语言课程视频,需要准确发音的配音支持,并处理不同语言的读音要求。
- 自媒体运营者:管理多个账号的日常视频更新,需要批量生成配音并跟踪任务状态以避免重复付费。