Agent Skills
返回列表
大模型视觉问答分析

大模型视觉问答分析

知识管理 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bb47e3e3/visual-qa-analysis。

技能介绍

问题:开放式图片问答的上下文缺口

工程师常遇到“看图说话”不止于标签:需要从图表读趋势、从文档抓关键信息、从图像推理背景。传统 CV 输出碎片化标签,而单独 LLM 又缺少像素级视觉证据。visual-qa-analysis 面向这类跨模态问答问题,把图片内容理解和自然语言推理放在同一条链路里处理。

工作方式:CV 解析 + LLM 推理 + 云端记录

核心流程包括:

  • 图片输入:支持 jpg、png、jpeg、webp,最大 20MB,可传本地路径或公网 URL。
  • 视觉解析:通过 CV 识别物体、场景、文字与图表数据,形成可供模型推理的结构化线索。
  • 开放式问答:结合 LLM 做语义理解、逻辑推理与知识关联,不需要预设答案模板。
  • 历史记录:使用 --list 从云端接口获取问答记录,并以 Markdown 表格输出 reportImageUrl 链接。

边界:适合分析,不适合替代人工核验

该技能依赖大模型生成,回答仅供参考;重要信息仍需核验。历史查询被限制为云端接口,不应从本地记忆文件汇总。脚本需在技能根目录运行,open-id 必须来自用户提供或有效获取,不能自行假设。

使用场景

  • 在需求评审时,用图片问图表的核心趋势与异常点
  • 核对设计稿截图中的组件状态、文字细节是否遗漏
  • 在培训答疑中,解释图片里的建筑风格和时期
  • 整理云端历史问答,定位某次图片问题的回答

适合人员

  • 负责验收产品截图的测试工程师:快速核对界面文字与组件状态
  • 做数据报告的分析师:向图表提问趋势、异常和指标含义
  • 准备课程材料的讲师:解释图片中的对象、场景与知识背景
  • 维护视觉问答记录的工程人员:从云端接口查询历史问题和回答