Agent Skills
返回列表
课程视频数字人讲师

课程视频数字人讲师

教育学习 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,将 @beatra-ai/course-video-studio 安装到你的 AI 助手中。

技能介绍

解决什么问题

做口播课程视频时,常见瓶颈不是文案,而是把“讲稿、讲师形象、声音授权、分段视频”串成稳定流程。课程团队往往有固定讲师人像和逐课讲稿,但每讲音频长度不同、术语读音不一致、视频模型只接受特定图片和音频格式。本技能面向这种场景:用一张获权讲师人像和最终讲稿,生成按课次顺序交付的数字人口播课视频。

技能如何工作

  • 输入冻结:先确认人像 MIME 类型、尺寸、字节大小、画幅、alpha 通道,并建立课次台账。讲稿、声音权利和术语读音表必须明确;若讲稿含反复出现的人名、术语或缩写,却没有读音表,流程会停下来收集读法。
  • 声音选择:可选用目录声音,或在获得同意和余额确认后克隆声音。克隆调用会先进入确认卡,冻结 voice_id 后再进入后续阶段。
  • 配音与视频兼容检查:技能会查询 TTS 与 image_to_video 的模型能力,比较真实音频的 mime_type、时长和大小是否可被视频路线接受,并在句或节边界把讲稿拆成可容纳分段。
  • 逐讲交付:每段音频确认后才进入视频生成,视频时长选择“不短于真实语音长度的最小受支持整数时长”,最后按课次和分段顺序交付,并附真实尺寸、时长与用量。

适用边界

它不做音频课包,不做单条讲述者短片,也不解析 PPT 或幻灯片。只有当用户已经抽出可说文本时,课件内容才可进入讲稿。涉及形象、声音和计费授权时必须先确认;媒体格式不兼容或余额不足时,流程会停在付费调用前,而不是静默改格式或猜结果。

使用场景

  • 在线课程团队要把已定稿的多讲讲稿,用同一获权讲师人像生成带配音的口播视频。
  • 培训交付负责人需要把术语密集的试点讲拆成可容纳片段,并核对读音和音频时长后再生成视频。
  • 教育产品运营要为每周新增课程准备可复核的数字人讲师片段,按课次顺序交付并附尺寸、时长和用量。
  • 独立讲师在确认声音克隆授权和余额后,将单讲最终讲稿转为带真实音频复核的视频片段。

适合人员

  • 在线课程制作人:要把稳定讲师形象和最终讲稿逐讲转成可交付口播视频。
  • 企业培训负责人:需要把术语读法、声音授权和视频分段确认后再制作课程片段。
  • 教育产品工程师:需要按真实音频时长和模型兼容格式控制 TTS 与 image_to_video 调用。
  • 独立讲师:希望在一讲音频确认后才启动视频生成,并复核术语读音与口型时机。