大模型视觉问答分析
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bb47e3e3/visual-qa-analysis。
技能介绍
问题:开放式图片问答的上下文缺口
工程师常遇到“看图说话”不止于标签:需要从图表读趋势、从文档抓关键信息、从图像推理背景。传统 CV 输出碎片化标签,而单独 LLM 又缺少像素级视觉证据。visual-qa-analysis 面向这类跨模态问答问题,把图片内容理解和自然语言推理放在同一条链路里处理。
工作方式:CV 解析 + LLM 推理 + 云端记录
核心流程包括:
- 图片输入:支持
jpg、png、jpeg、webp,最大20MB,可传本地路径或公网URL。 - 视觉解析:通过 CV 识别物体、场景、文字与图表数据,形成可供模型推理的结构化线索。
- 开放式问答:结合 LLM 做语义理解、逻辑推理与知识关联,不需要预设答案模板。
- 历史记录:使用
--list从云端接口获取问答记录,并以 Markdown 表格输出reportImageUrl链接。
边界:适合分析,不适合替代人工核验
该技能依赖大模型生成,回答仅供参考;重要信息仍需核验。历史查询被限制为云端接口,不应从本地记忆文件汇总。脚本需在技能根目录运行,open-id 必须来自用户提供或有效获取,不能自行假设。
使用场景
- 在需求评审时,用图片问图表的核心趋势与异常点
- 核对设计稿截图中的组件状态、文字细节是否遗漏
- 在培训答疑中,解释图片里的建筑风格和时期
- 整理云端历史问答,定位某次图片问题的回答
适合人员
- 负责验收产品截图的测试工程师:快速核对界面文字与组件状态
- 做数据报告的分析师:向图表提问趋势、异常和指标含义
- 准备课程材料的讲师:解释图片中的对象、场景与知识背景
- 维护视觉问答记录的工程人员:从云端接口查询历史问题和回答