Agent Skills
返回列表
PPT转视频生成器

PPT转视频生成器

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_460920f7/ppt-to-video。

技能介绍

要解决的问题

制作演讲视频时,通常需要将 PDF 幻灯片与 Markdown 格式的演讲稿同步,生成带字幕的完整视频。手动操作涉及多个工具(如视频编辑软件、TTS 服务和字幕添加),过程繁琐且容易出错。特别是需要精确对齐音频时间戳、处理超长句子或支持声音克隆时,技术门槛更高。对于希望自动化这一流程的开发者,一个集成化的工具能显著减少重复工作。

工作原理与关键步骤

技能 ppt-to-video 提供了一套端到端的流水线,核心步骤包括:

  • 步骤 0:整理演讲稿格式。使用 LLM 将用户提供的任意格式脚本转换为标准 Markdown 结构,确保页眉以 ## 第 X 页 划分,便于后续处理。
  • 步骤 1:提取人声(可选)。如果提供参考音频,使用 Demucs 分离人声,并自动筛选最佳片段(5-10 秒)用于声音克隆,支持从视频中提取。
  • 步骤 2:处理演讲稿。解析 Markdown,清洗格式(如移除 **粗体***斜体*),拆分句子(处理超长句),生成 TTS 友好文本,包括目录路径的口语化转换(例如 ~/.codebuddy/skills/ 变为“家目录下 codebuddy skills 目录”)。
  • 步骤 3:语音合成。支持两种 TTS 引擎:优先使用 Qwen3-TTS(本地运行,基于阿里通义千问,支持声音克隆)或备选 edge-tts(微软免费在线服务,仅预设音色)。引擎自动检测,生成逐句音频,插入停顿(默认句子间 0.4 秒、页面间 1.0 秒),并记录精确时间元数据到 timing_data.json
  • 步骤 4:生成幻灯片视频。有两种模式:传统模式使用 FFmpeg 从 PDF 截图生成视频;Remotion 模式要求使用原生 TSX 组件重新设计视觉内容,确保动画帧与 timing_data.json 时间戳对齐,避免截图的低分辨率和动画限制。
  • 步骤 5:合并组件。将视频、音频和字幕合并为最终 final_presentation.mp4。字幕默认使用白色文字、PingFang SC 字体、黑色描边,支持烧录或软字幕模式。

技能内置断点续传、进程锁和引擎一致性检查,确保流水线稳定运行,例如中断后重新运行会跳过已完成的 TTS 音频。

注意事项与限制

  • 输入要求:必须提供 PDF 幻灯片和按页划分的 Markdown 演讲稿(格式如 ## 第 1 页)。演讲稿需符合标准,建议先运行输入校验脚本检查页数匹配和格式。
  • 依赖工具:核心依赖包括 FFmpeg(用于音视频处理)、Python 3.8+ 和特定包(如 PyMuPDF 用于 PDF 转换)。TTS 引擎需安装 qwen-ttsedge-tts;可选 Whisper(用于步骤 1 语音转文字)和 Demucs(人声分离)。
  • 性能与资源Qwen3-TTS 本地运行需要较大内存(建议 8GB+),而 edge-tts 需联网。视频生成耗时取决于幻灯片数量和分辨率(默认 1920x1080)。
  • 音视频同步:确保 timing_data.json 时间数据一致,使用 24kHz 采样率。字幕渲染依赖系统字体,如 Linux 系统需替换为 Noto Sans CJK SC
  • 重新生成:支持单句 TTS 重新生成,使用 --regenerate 参数指定句子,自动更新时间数据并重新合并视频。

该技能为技术人员提供了灵活且强大的自动化工具,但需注意环境配置和依赖管理,以避免常见问题如 TTS 加载失败或字体缺失。

使用场景

  • 技术博主需要将年度技术总结的PDF幻灯片和Markdown演讲稿,转换为带同步字幕的视频,用于在视频平台发布,要求本地处理以确保代码示例清晰。
  • 在线教育讲师使用Markdown格式的课件脚本和PDF幻灯片,通过声音克隆生成专属配音的课程视频,要求字幕与讲解精确同步以辅助学习。
  • 企业培训部门将产品介绍PPT和讲解稿转换为视频,需在内网环境本地运行以保护敏感内容,并使用自定义音色保持品牌一致性。
  • 自媒体创作者用PDF幻灯片和短脚本制作教程视频,需要快速迭代支持单句重新生成,以优化语音效果和字幕时序。

适合人员

  • 技术内容创作者:定期将技术演讲PPT转为带解说视频,发布到YouTube或B站,需要自动化处理多页幻灯片和代码演示。
  • 在线课程讲师:为课件添加专业配音和精确字幕,以提升学习体验,要求声音克隆匹配个人音色并处理长句分段。
  • 企业内训师:制作内部培训视频,需使用公司品牌声音并确保数据隐私,要求本地TTS引擎避免云端传输风险。
  • 自由职业视频制作者:为客户批量生成演讲视频,追求高质量音效和可定制字幕样式,需要灵活调整单句语音。