Agent Skills
返回列表
视频主体分析与关键帧选择

视频主体分析与关键帧选择

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @vidu/video-analyzer-2 到你的 AI 助手中。

技能介绍

问题

短视频素材往往需要人工翻看后才能回答“主体是谁、动作发生在哪、哪一帧适合展示”。如果直接用均匀采样取帧,既会漏掉关键动作,也会把大量近似帧送进视觉模型,造成 token 浪费。

工作方式

该技能围绕视频分析做了一件明确的事:从视频中自动提取关键帧,并调用视觉模型生成可读报告。

  • 先用 ffmpeg 获取时长、分辨率、编码等元数据
  • 使用 scripts/extract_keyframes.sh 基于 I 帧检测 抽取关键帧
  • 输出 640px 宽度的 JPEG 图片,便于视觉模型理解
  • 对提取到的关键帧做内容分析,最终给出文本报告和 3 张代表性截图

边界与注意点

它适合短视频主体识别、动作概括、封面帧候选选择等场景;对极长视频或强连续动作的细粒度追踪,仍需补充时间戳、动作事件或更多分析维度。资料中的 token 估算仅适用于其示例参数,实际消耗仍会受分辨率、帧数和模型行为影响。

使用场景

  • 拿到一段 5~30 秒短视频后,需要快速判断画面主体、动作阶段,并选出 3 张可展示的截图。
  • 收到飞书发来的视频素材,需要自动落盘、读取时长分辨率,并避免人工逐帧翻看。
  • 为短视频生成分析摘要时,要用 I 帧检测减少重复帧,再交给视觉模型总结主体内容。
  • 需要向业务方交付视频理解结果时,生成文本报告并附上 3 张代表性截图用于复核。

适合人员

  • 负责短视频素材初筛、需要快速确认主体与关键画面的剪辑助理
  • 要把飞书视频转成结构化摘要并附截图的产品运营
  • 调试视觉模型视频理解链路、关注关键帧 token 消耗的工程师
  • 需要给业务方输出视频主体报告和多张候选截图的设计支持