Agent Skills
返回列表
教学视频配音字幕合成

教学视频配音字幕合成

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a5827f21/video-tutorial-v2-publish。

技能介绍

解决什么问题

制作教学视频时,文案、时间点、TTS、字幕和成片往往分散在多个工具里。手写时间码费时,讯飞或 edge-tts 配置、ffmpeg 环境、模板格式、失败重试也容易让流程中断。这个技能把“配音-字幕-合成”拆成一条可恢复的流水线,让用户主要提供视频、文案和音色偏好,由 AI 按固定步骤补齐配置与执行。

它如何工作

  • 模板制作:可使用内置 subtitle-editor.html 在浏览器中拖入视频,按 F 拍板记录时间点,用 ← → 逐帧微调,并一键生成模板提示词;也支持直接填写 script_template.md。
  • 环境检查:自动创建 _scripts/,复制 Python 脚本,检测 ffmpeg、websocket-client、edge-tts 等依赖,缺失时给出安装建议或自动完成包安装。
  • TTS 选择:支持讯飞 spark 与 edge-tts 两套音色;讯飞需填写 tts_config.json 凭证,edge-tts 则直接选择 Xiaoxiao、Yunxi 等语音。
  • 任务执行:生成 job.yaml 后运行 pipeline.py,按步骤完成切分、TTS、对齐、字幕和合成;失败时读取 resume 命令进行重试。
  • 字幕细节:支持 MM:SS,FF 帧号、MM:SS.mmm 小数时间,数学符号会转口语,模板里的多音字或断句标记可辅助发音。

注意边界

该技能依赖本地 ffmpeg 与 Python 环境;讯飞模式涉及第三方凭证,应加入 .gitignore。edge-tts 依赖网络服务与包版本,国内网络可能需要镜像源。模板时间码要按帧号理解,MM:SS,FF 中的逗号不是小数点;正式分享前应清除真实 app_id、api_key、api_secret 与私有端点。

截图预览

使用场景

  • 老师录制完课程视频后,需要按讲义逐句生成中文配音和 SRT 字幕,并合并成可播放成片。
  • 课程制作人员已有按句编号的文案,想用讯飞或 edge-tts 选择不同音色,减少手动调 TTS 的时间。
  • 视频剪辑者想避免手填时间码,用字幕编辑器播放视频按 F 标记切点,再生成模板提示词给技能合成。
  • 培训负责人需要把数学公式口播读成“负5”“5加3”,并处理多音字或停顿,得到教学配音。

适合人员

  • 需要把录播课程转成配音成片的教育内容老师。
  • 负责制作在线课程字幕与旁白的课程制作人员。
  • 希望用浏览器工具对齐视频切换点、少写时间码的视频剪辑者。
  • 需要配置讯飞或 edge-tts 音色并处理失败重试的培训运营。