视觉摘要智述
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bb47e3e3/visual-summary-analysis 到你的 AI 助手中。
技能介绍
解决的问题
视频和图片通常包含主体、动作、背景和文字线索,但人工整理成自然语言描述成本较高。visual-summary-analysis 把这种视觉内容理解任务脚本化:给定本地图片或视频文件、公网 URL,输出连贯的场景摘要,并支持从云端查询历史摘要报告。
技能如何工作
- 输入:支持
jpg/jpeg/png/mp4/avi/mov,最大10MB;建议视频片段不超过 5 分钟,主体清晰且不被大面积遮挡。 - 分析:通过技能内置脚本
scripts.visual_summary_analysis调用 API,识别场景内容、物体、行为与文字,再整合成中文描述。 - 查询:历史报告只能通过
--list从云端接口读取,并以 Markdown 表格输出;不能依赖本地 memory 或长期记忆。 - 身份:系统内部自动处理身份关联,不对用户展示、询问或要求输入内部身份参数。
适用边界
该技能适合视频内容理解、无障碍辅助和媒体资产管理中的摘要生成。若输入模糊、片段过长、主体被遮挡,或需要非 10MB 大文件与私有内网地址,结果可能不稳定;处理 URL 时应使用 API 可访问的公网地址。
使用场景
- 视频内容运营需要把 3 分钟活动片段整理成文字摘要,便于归档和检索。
- 无障碍产品工程师需要把图片场景转成自然语言描述,辅助读屏理解。
- 媒体资产管理工程师需要为图片素材补充中文描述字段,完善资产元数据。
- 内容审核专员需要查询某一周的视觉摘要报告清单,按日期范围核对交付。
适合人员
- 视频内容运营,需要把活动、监控或素材片段整理成可归档的文字摘要。
- 无障碍产品工程师,需要把图片场景转成自然语言读屏描述。
- 媒体资产管理工程师,需要为图片素材批量补充中文描述字段。
- 内容审核专员,需要查询历史视觉摘要报告并按日期范围核对。