Agent Skills
返回列表
🎨

三分钟精读一本书视频生成器

设计多媒体 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_25bf452a/book-video-generator。

技能介绍

解决的问题

把一本书变成短视频,通常卡在三个环节:文案要像人讲,画面要稳定出图,配音和字幕要对得上。book-video-generator 针对这条链路做自动化:输入 book_name 和 author_name,输出一段约 3 分钟的 MP4 解说视频,减少手动写稿、抽卡生成插图和逐句配字幕的重复工作。

核心工作流

技能把流程拆成五个阶段:

  • 文案生成:先用当前平台的联网搜索获取书籍简介、出版年份和常见解读,再让 LLM 输出约 700-1000 字口播稿。
  • 分镜与章节:把文案拆成 8-50 个分镜,每镜包含字幕、画面描述和图像提示词;同时生成 4 个板块标题,用于顶部进度条。
  • 素材生成:按分镜生成 1024x768 扁平插画,调用 ImageGen、火山即梦、Gemini 或 Agnes 等图像 API;再对字幕文案做 TTS,优先火山引擎 TTS,无凭证时回退 edge-tts。
  • 视频合成:compose_video.py 用 ffmpeg 将图片、音频、ASS 字幕、封面图、BGM 和转场音效合成 1920x1080 视频,字幕支持关键词高亮和入出场动画。

适用边界

  • 图像和 TTS 都依赖外部模型;CLI 环境需要配置对应 API key 或 MCP/脚本能力。
  • 火山 TTS 的词级时间戳是基于音频时长估算,edge-tts 的原生时间戳通常更准。
  • 包内不一定带 BGM 和翻页音效,缺失时仍出视频,只是没有背景声。
  • 它适合固定风格的书籍解说短视频,不适合需要真实人物、复杂运镜或多语言翻译的成片。

使用场景

  • 读书号运营要把一本纸质书快速做成 3 分钟解说视频,需要文案、分镜、插图、配音和字幕一次产出。
  • 内容测试团队要验证同一本书在不同图像 API 下的视觉风格,切换火山即梦、Gemini 或 Agnes 后重新出分镜图。
  • 视频剪辑外包需要把 LLM 生成的口播稿拆成单行 ASS 字幕,并依据 TTS 时间戳做关键词高亮和入出场动画。
  • 跨平台 Agent 开发者要在 Codex CLI 或 TRAE Work 中复用工作流,调用外部图像/TTS API 生成同一本书的 MP4 短片。

适合人员

  • 负责读书类账号内容生产的创作者,要少写分镜、少抽卡出图、少逐句配字幕。
  • 做 Agent 工具链验证的平台工程师,要在不同平台比较图像生成、TTS 和 ffmpeg 合成脚本的可用性。
  • 需要批量产出书籍解说短视频的内容运营,要从书名和作者名直接拿到可发布的 MP4 素材。
  • 使用 WorkBuddy/OpenClaw/TRAE Work 的自动化工程师,要把原扣子工作流改造成可跨平台运行的 Skill。