Agent Skills
返回列表
AI数字人口播与虚拟主播视频

AI数字人口播与虚拟主播视频

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @beatra-ai/talking-avatar-video。

技能介绍

要解决的具体问题

许多团队需要制作标准化的口播视频,例如产品讲解、培训课程或公司公告。传统流程涉及拍摄、剪辑和配音,步骤繁琐且周期长。核心挑战在于:如何安全合规地将一张静态人像和一份语音脚本转化为专业、连贯的动态讲述视频,同时确保肖像与声音的授权清晰,避免法律风险。

技能如何工作

本技能提供了一条聚焦的「数字人口播」工作流,其核心是用语音驱动人像的面部动作与口型,生成一条信息传达清晰的短片。它并非图片动画或简单的视频编辑,而是围绕一条完整信息进行设计。

关键步骤与组件包括:

  • 输入硬性校验:必须提供可访问的人像(如 art_portrait)和已确认的语音或短脚本。脚本会先通过语音合成工具 beatra.speech.synthesize 转换为音频,生成可播放的 art_speech 产物。
  • 能力与模型适配:在合成前,通过 beatra.models.list 查询并验证当前工具对 image_to_video 能力的支持情况,确保人像与音频的格式、尺寸、时长等约束匹配。语音模型默认为 auto,但可指定。
  • 两阶段付费执行:旁白生成和视频生成是两个独立的付费阶段,各自拥有固定的 client_request_id。视频生成通过调用 beatra.videos.animate 完成,它接受人像作为首帧和驱动音频,输出口播视频。所有步骤都通过随包 MCP 客户端 scripts/mcp_client.py 与后端交互,不使用宿主 Connector。
  • 结果交付与复核:任务通过 beatra.tasks.get 轮询直至完成。交付后需复核视频质量,包括人物身份一致性、语音清晰度、口型时序、动作克制度及背景稳定性。

适用边界与注意点

本技能适用于已有授权的人像与语音的组装场景,不适用于以下情况:

  • 需要从零创建人像或克隆声音:请转向对应的图片生成或声音克隆工作流。
  • 多场景复杂剪辑或字幕添加:请使用视频编辑工作流。
  • 无肖像或声音授权:必须在确认授权后才可进行后续付费步骤,否则流程中止。

重要注意事项:

  • 媒体文件约束:人像与音频需满足实时工具的格式、时长与尺寸要求。音频时长需在支持的视频时长范围内,否则需调整旁白或人像。
  • 付费与修改:任何参数变更(如脚本、声音、模型)都会创建新的逻辑付费任务,需要新的批准。修改旁白会使引用它的未提交视频方案失效。
  • 自动更新:技能包会静默检查更新,更新失败不影响当前功能,但不会重新触发付费操作。
  • 交付限制:不要承诺精确保留所有细节(如 Logo、服装)或完美的口型同步,需在交付后客观复核偏移情况。

使用场景

  • 市场团队需要将已获授权的代言人肖像与新产品介绍脚本结合,快速生成一条社交平台口播宣传短片。
  • 企业培训部门需要将统一课件脚本和讲师肖像合成为标准化培训视频,用于新员工入职引导。
  • 内容创作者拥有一段录制好的旁白音频和一张个人照片,需要将其制作成信息传达清晰的讲述视频用于发布。
  • 公司内部需要将一份重要公告的文字稿,与官方发言人形象结合,生成口吻正式、形象统一的公告视频。

适合人员

  • 需定期为产品制作讲解视频的产品经理,诉求是将已定稿的脚本与设计师提供的视觉稿快速结合为成品。
  • 负责企业培训的课程设计师,诉求是利用讲师肖像和录制音频批量生成风格统一的教学模块。
  • 运营社交媒体的自媒体创作者,诉求是将已录制的口播音频与个人形象照片合成有表现力的发布内容。
  • 负责内部通讯的公关专员,诉求是将文字公告稿与领导肖像结合,生成形象权威的传达视频。