教学视频配音字幕合成
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a5827f21/video-tutorial-v2-publish。
技能介绍
解决什么问题
制作教学视频时,文案、时间点、TTS、字幕和成片往往分散在多个工具里。手写时间码费时,讯飞或 edge-tts 配置、ffmpeg 环境、模板格式、失败重试也容易让流程中断。这个技能把“配音-字幕-合成”拆成一条可恢复的流水线,让用户主要提供视频、文案和音色偏好,由 AI 按固定步骤补齐配置与执行。
它如何工作
- 模板制作:可使用内置
subtitle-editor.html在浏览器中拖入视频,按F拍板记录时间点,用←→逐帧微调,并一键生成模板提示词;也支持直接填写script_template.md。 - 环境检查:自动创建
_scripts/,复制 Python 脚本,检测ffmpeg、websocket-client、edge-tts等依赖,缺失时给出安装建议或自动完成包安装。 - TTS 选择:支持讯飞
spark与edge-tts两套音色;讯飞需填写tts_config.json凭证,edge-tts则直接选择Xiaoxiao、Yunxi等语音。 - 任务执行:生成
job.yaml后运行pipeline.py,按步骤完成切分、TTS、对齐、字幕和合成;失败时读取resume命令进行重试。 - 字幕细节:支持
MM:SS,FF帧号、MM:SS.mmm小数时间,数学符号会转口语,模板里的多音字或断句标记可辅助发音。
注意边界
该技能依赖本地 ffmpeg 与 Python 环境;讯飞模式涉及第三方凭证,应加入 .gitignore。edge-tts 依赖网络服务与包版本,国内网络可能需要镜像源。模板时间码要按帧号理解,MM:SS,FF 中的逗号不是小数点;正式分享前应清除真实 app_id、api_key、api_secret 与私有端点。
截图预览
使用场景
- 老师录制完课程视频后,需要按讲义逐句生成中文配音和 SRT 字幕,并合并成可播放成片。
- 课程制作人员已有按句编号的文案,想用讯飞或 edge-tts 选择不同音色,减少手动调 TTS 的时间。
- 视频剪辑者想避免手填时间码,用字幕编辑器播放视频按 F 标记切点,再生成模板提示词给技能合成。
- 培训负责人需要把数学公式口播读成“负5”“5加3”,并处理多音字或停顿,得到教学配音。
适合人员
- 需要把录播课程转成配音成片的教育内容老师。
- 负责制作在线课程字幕与旁白的课程制作人员。
- 希望用浏览器工具对齐视频切换点、少写时间码的视频剪辑者。
- 需要配置讯飞或 edge-tts 音色并处理失败重试的培训运营。
