Agent Skills
返回列表
视觉摘要智述

视觉摘要智述

知识管理 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bb47e3e3/visual-summary-analysis 到你的 AI 助手中。

技能介绍

解决的问题

视频和图片通常包含主体、动作、背景和文字线索,但人工整理成自然语言描述成本较高。visual-summary-analysis 把这种视觉内容理解任务脚本化:给定本地图片或视频文件、公网 URL,输出连贯的场景摘要,并支持从云端查询历史摘要报告。

技能如何工作

  • 输入:支持 jpg/jpeg/png/mp4/avi/mov,最大 10MB;建议视频片段不超过 5 分钟,主体清晰且不被大面积遮挡。
  • 分析:通过技能内置脚本 scripts.visual_summary_analysis 调用 API,识别场景内容、物体、行为与文字,再整合成中文描述。
  • 查询:历史报告只能通过 --list 从云端接口读取,并以 Markdown 表格输出;不能依赖本地 memory 或长期记忆。
  • 身份:系统内部自动处理身份关联,不对用户展示、询问或要求输入内部身份参数。

适用边界

该技能适合视频内容理解、无障碍辅助和媒体资产管理中的摘要生成。若输入模糊、片段过长、主体被遮挡,或需要非 10MB 大文件与私有内网地址,结果可能不稳定;处理 URL 时应使用 API 可访问的公网地址。

使用场景

  • 视频内容运营需要把 3 分钟活动片段整理成文字摘要,便于归档和检索。
  • 无障碍产品工程师需要把图片场景转成自然语言描述,辅助读屏理解。
  • 媒体资产管理工程师需要为图片素材补充中文描述字段,完善资产元数据。
  • 内容审核专员需要查询某一周的视觉摘要报告清单,按日期范围核对交付。

适合人员

  • 视频内容运营,需要把活动、监控或素材片段整理成可归档的文字摘要。
  • 无障碍产品工程师,需要把图片场景转成自然语言读屏描述。
  • 媒体资产管理工程师,需要为图片素材批量补充中文描述字段。
  • 内容审核专员,需要查询历史视觉摘要报告并按日期范围核对。