灵声工坊视频配音
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a5827f21/smart-dubbing-studio。
技能介绍
解决视频配音与字幕合成的对齐难题
制作中文教程或视频时,手动对齐字幕时间码、处理 TTS 引擎的断句停顿,以及应对配音时长与原视频不匹配导致的音画错位,往往非常繁琐。smart-dubbing-studio 将这些操作封装为一条自动化的流水线,通过 AI 对话引导完成环境检测、引擎配置与任务执行,免除手动编写脚本的负担。
核心能力与工作流
- 双引擎 TTS 支持:兼容讯飞
spark(支持词级时间戳与多音色)和edge-tts(免 API 密钥,备用引擎),AI 会自动引导选择并映射对应的vcn或voice参数。 - 精细化的模板控制:支持
MM:SS,FF帧级时间码解析;通过留空标记filler段以保留原声,或写入(静音)生成静音;使用反引号 ``强制 TTS 断句而不影响字幕显示,甚至可用{tts:...}` 手动覆盖特定读音。 - 逐帧打点编辑器:内置
subtitle-editor.html本地工具,通过F键标记段落结束、G键制造间隙,支持Ctrl+Z撤销与localStorage自动缓存,解决对照视频手动写时间码的痛点。 - V3.7 核心升级:基于词级时间戳自动将长文案拆分为“读一句显示一句”的短句 SRT;当配音比原视频短 2% 以上时,自动调用
ffmpeg的setpts和atempo滤镜进行最高 1.5x 的视频加速,保持音画同步。
适用边界与注意点
- SRT 拆分依赖词级时间戳:讯飞
spark引擎能完美支持逐短句字幕,而edge-tts默认回退为整段字幕显示。 - 环境依赖:本地必须安装
ffmpeg和 Python 3.7+,相关 Python 依赖包会在首次运行时自动安装(支持国内镜像)。 - 凭证安全:使用讯飞引擎需配置
APPID、APIKey等凭证至tts_config.json,分享项目前务必清除该文件或使用占位符,防止敏感信息泄露。
截图预览
使用场景
- 制作课程录屏时,按字幕模板和 F 键打点,调用讯飞 TTS 生成配音并合成带 SRT 字幕的视频。
- 已有讲解视频,需让操作演示保留原声、纯画面静音,并仅重做最后一步字幕样式而不重跑 TTS。
- 当 AI 配音比原录屏短 2% 以上时,自动用 ffmpeg 加速视频并保留音画同步,输出最终带字幕视频。
- 用 edge-tts 作为备选 TTS 完成中文配音,并让数学符号、第X步和括号数字被转成自然读法。
适合人员
- 制作中文课程录屏的教师,需要快速给讲解配普通话配音并生成可校对的字幕。
- 负责技术教程外包剪辑的运营,需要统一用模板打点、替换 TTS 音色和重做硬字幕。
- 需要处理含数学公式的讲解视频的讲师,需要把符号和括号数字读成自然口语且不改动字幕文本。
- 使用 edge-tts 备选方案的独立开发者,需要无 API 密钥完成中文配音和字幕合成。
