视频主体分析与关键帧选择
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @vidu/video-analyzer-2 到你的 AI 助手中。
技能介绍
问题
短视频素材往往需要人工翻看后才能回答“主体是谁、动作发生在哪、哪一帧适合展示”。如果直接用均匀采样取帧,既会漏掉关键动作,也会把大量近似帧送进视觉模型,造成 token 浪费。
工作方式
该技能围绕视频分析做了一件明确的事:从视频中自动提取关键帧,并调用视觉模型生成可读报告。
- 先用
ffmpeg获取时长、分辨率、编码等元数据 - 使用
scripts/extract_keyframes.sh基于 I 帧检测 抽取关键帧 - 输出
640px宽度的JPEG图片,便于视觉模型理解 - 对提取到的关键帧做内容分析,最终给出文本报告和 3 张代表性截图
边界与注意点
它适合短视频主体识别、动作概括、封面帧候选选择等场景;对极长视频或强连续动作的细粒度追踪,仍需补充时间戳、动作事件或更多分析维度。资料中的 token 估算仅适用于其示例参数,实际消耗仍会受分辨率、帧数和模型行为影响。
使用场景
- 拿到一段 5~30 秒短视频后,需要快速判断画面主体、动作阶段,并选出 3 张可展示的截图。
- 收到飞书发来的视频素材,需要自动落盘、读取时长分辨率,并避免人工逐帧翻看。
- 为短视频生成分析摘要时,要用 I 帧检测减少重复帧,再交给视觉模型总结主体内容。
- 需要向业务方交付视频理解结果时,生成文本报告并附上 3 张代表性截图用于复核。
适合人员
- 负责短视频素材初筛、需要快速确认主体与关键画面的剪辑助理
- 要把飞书视频转成结构化摘要并附截图的产品运营
- 调试视觉模型视频理解链路、关注关键帧 token 消耗的工程师
- 需要给业务方输出视频主体报告和多张候选截图的设计支持