Agent Skills
返回列表
灵声工坊视频配音

灵声工坊视频配音

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a5827f21/smart-dubbing-studio。

技能介绍

解决视频配音与字幕合成的对齐难题

制作中文教程或视频时,手动对齐字幕时间码、处理 TTS 引擎的断句停顿,以及应对配音时长与原视频不匹配导致的音画错位,往往非常繁琐。smart-dubbing-studio 将这些操作封装为一条自动化的流水线,通过 AI 对话引导完成环境检测、引擎配置与任务执行,免除手动编写脚本的负担。

核心能力与工作流

  • 双引擎 TTS 支持:兼容讯飞 spark(支持词级时间戳与多音色)和 edge-tts(免 API 密钥,备用引擎),AI 会自动引导选择并映射对应的 vcn 或 voice 参数。
  • 精细化的模板控制:支持 MM:SS,FF 帧级时间码解析;通过留空标记 filler 段以保留原声,或写入 (静音) 生成静音;使用反引号 ` ` 强制 TTS 断句而不影响字幕显示,甚至可用 {tts:...}` 手动覆盖特定读音。
  • 逐帧打点编辑器:内置 subtitle-editor.html 本地工具,通过 F 键标记段落结束、G 键制造间隙,支持 Ctrl+Z 撤销与 localStorage 自动缓存,解决对照视频手动写时间码的痛点。
  • V3.7 核心升级:基于词级时间戳自动将长文案拆分为“读一句显示一句”的短句 SRT;当配音比原视频短 2% 以上时,自动调用 ffmpeg 的 setpts 和 atempo 滤镜进行最高 1.5x 的视频加速,保持音画同步。

适用边界与注意点

  • SRT 拆分依赖词级时间戳:讯飞 spark 引擎能完美支持逐短句字幕,而 edge-tts 默认回退为整段字幕显示。
  • 环境依赖:本地必须安装 ffmpeg 和 Python 3.7+,相关 Python 依赖包会在首次运行时自动安装(支持国内镜像)。
  • 凭证安全:使用讯飞引擎需配置 APPID、APIKey 等凭证至 tts_config.json,分享项目前务必清除该文件或使用占位符,防止敏感信息泄露。

截图预览

使用场景

  • 制作课程录屏时,按字幕模板和 F 键打点,调用讯飞 TTS 生成配音并合成带 SRT 字幕的视频。
  • 已有讲解视频,需让操作演示保留原声、纯画面静音,并仅重做最后一步字幕样式而不重跑 TTS。
  • 当 AI 配音比原录屏短 2% 以上时,自动用 ffmpeg 加速视频并保留音画同步,输出最终带字幕视频。
  • 用 edge-tts 作为备选 TTS 完成中文配音,并让数学符号、第X步和括号数字被转成自然读法。

适合人员

  • 制作中文课程录屏的教师,需要快速给讲解配普通话配音并生成可校对的字幕。
  • 负责技术教程外包剪辑的运营,需要统一用模板打点、替换 TTS 音色和重做硬字幕。
  • 需要处理含数学公式的讲解视频的讲师,需要把符号和括号数字读成自然口语且不改动字幕文本。
  • 使用 edge-tts 备选方案的独立开发者,需要无 API 密钥完成中文配音和字幕合成。