三分钟精读一本书视频生成器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_25bf452a/book-video-generator。
技能介绍
解决的问题
把一本书变成短视频,通常卡在三个环节:文案要像人讲,画面要稳定出图,配音和字幕要对得上。book-video-generator 针对这条链路做自动化:输入 book_name 和 author_name,输出一段约 3 分钟的 MP4 解说视频,减少手动写稿、抽卡生成插图和逐句配字幕的重复工作。
核心工作流
技能把流程拆成五个阶段:
- 文案生成:先用当前平台的联网搜索获取书籍简介、出版年份和常见解读,再让 LLM 输出约
700-1000字口播稿。 - 分镜与章节:把文案拆成
8-50个分镜,每镜包含字幕、画面描述和图像提示词;同时生成 4 个板块标题,用于顶部进度条。 - 素材生成:按分镜生成
1024x768扁平插画,调用ImageGen、火山即梦、Gemini或Agnes等图像 API;再对字幕文案做 TTS,优先火山引擎 TTS,无凭证时回退edge-tts。 - 视频合成:
compose_video.py用ffmpeg将图片、音频、ASS字幕、封面图、BGM 和转场音效合成1920x1080视频,字幕支持关键词高亮和入出场动画。
适用边界
- 图像和 TTS 都依赖外部模型;CLI 环境需要配置对应
API key或 MCP/脚本能力。 - 火山 TTS 的词级时间戳是基于音频时长估算,
edge-tts的原生时间戳通常更准。 - 包内不一定带 BGM 和翻页音效,缺失时仍出视频,只是没有背景声。
- 它适合固定风格的书籍解说短视频,不适合需要真实人物、复杂运镜或多语言翻译的成片。
使用场景
- 读书号运营要把一本纸质书快速做成 3 分钟解说视频,需要文案、分镜、插图、配音和字幕一次产出。
- 内容测试团队要验证同一本书在不同图像 API 下的视觉风格,切换火山即梦、Gemini 或 Agnes 后重新出分镜图。
- 视频剪辑外包需要把 LLM 生成的口播稿拆成单行 ASS 字幕,并依据 TTS 时间戳做关键词高亮和入出场动画。
- 跨平台 Agent 开发者要在 Codex CLI 或 TRAE Work 中复用工作流,调用外部图像/TTS API 生成同一本书的 MP4 短片。
适合人员
- 负责读书类账号内容生产的创作者,要少写分镜、少抽卡出图、少逐句配字幕。
- 做 Agent 工具链验证的平台工程师,要在不同平台比较图像生成、TTS 和 ffmpeg 合成脚本的可用性。
- 需要批量产出书籍解说短视频的内容运营,要从书名和作者名直接拿到可发布的 MP4 素材。
- 使用 WorkBuddy/OpenClaw/TRAE Work 的自动化工程师,要把原扣子工作流改造成可跨平台运行的 Skill。