Agent Skills
返回列表
抖音竖版口播短视频生成器

抖音竖版口播短视频生成器

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_40cf8716/douyin-video-generator

技能介绍

解决的问题

做抖音口播短视频时,真正卡住人的往往不是剪辑本身,而是从选题、笔记或文章到可发布视频之间的素材链:口播文案的钩子不够强、9:16 配图风格不一致、TTS 音频格式与 Remotion 不兼容、字幕时间轴缺失、渲染参数散落各处。手工拼接这些材料时,很容易在“文案能读、画面能看、音频能播、字幕能对齐”之间反复返工。

工作流

该技能把输入收敛为 input/videos.json,再按固定本地 pipeline 输出 renders/{name}.mp4:

  • 口播文案先行:读取 Obsidian 路径、文章 URL 或纯文本,生成 45-90 秒、6-8 段 script,要求 hook 开头、单段单点、cta 收尾,避免“大家好今天聊聊”这类低信息量开场。
  • 场景化视觉编排:为每个 scene 写入 kind、accent、detail,让 hook、core、compare、data、cta 分别使用不同字号、布局与强调方式,而不是只换一张背景图。
  • 本地渲染链路:依赖 Node.js、Remotion 4.x、Chrome Headless Shell、say 或 MiniMax API,把图片、.m4a 音频和字幕时间轴写入 manifest,再渲染成 MP4。

边界与注意

它更适合能运行本地 Node/Remotion 环境的工程师,不适合希望完全云端生成、零环境配置的出片流程。使用时要关注三个点:图片生成尽量并行,避免串行超时;TTS 输出必须转为 .m4a,否则 Remotion 可能拒绝 AIFF 格式;当 TTS 未返回字幕时,技能会基于 narrationText 分句并按字符比例估算 startMs / endMs。

使用场景

  • 把 Obsidian 笔记或文章 URL 转成 45-90 秒抖音口播视频,并输出 MP4。
  • 为每个分镜生成 9:16 无文字配图,并用 hook、core、data 和 cta 布局成片。
  • 用 macOS say 或 MiniMax API 配音,生成 .m4a 音频和字幕时间轴。
  • 在本地 Remotion 工程里渲染竖版口播成片,不依赖云端剪辑平台。

适合人员

  • 需要把公众号文章或选题笔记快速改成抖音口播视频的内容编辑
  • 希望用本地 Node/Remotion 环境批量生成 9:16 竖版视频的技术作者
  • 需要统一 scene 布局、字幕与配音格式的视频流水线开发者
  • 想用本地脚本减少云端剪辑依赖的短视频运营