Qwen-VL 图片识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_213bfd3b/qwen-vl-image-reader。
技能介绍
问题
很多 Agent 使用纯文本大语言模型作为推理引擎。用户发送截图、文档照片、图表、二维码或表格时,模型本身无法直接读取图片内容,只能回复看不到。直接更换多模态主模型又可能带来成本、部署和兼容性问题。
如何工作
本技能在 Agent 和纯文本推理引擎之间增加一个视觉预处理层。当用户发送 png、jpg、jpeg、webp 或 bmp 图片,并要求查看、分析、总结或提取信息时,技能会调用 Qwen-VL,将图片理解结果整理为结构化 Markdown,再交给纯文本模型继续推理。它适合截图分析、文档识别、图表解读、照片描述、信息提取和表格识别等场景,可在 qwen-vl-plus 与 qwen-vl-max 之间切换,并支持中文 OCR、英文 OCR、图表理解和界面截图分析。
边界与注意
该技能依赖网络和有效的 DASHSCOPE_API_KEY,仅支持 png/jpg/jpeg/webp/bmp 格式。文件不存在、格式不支持、密钥缺失、网络失败、超时或图片损坏时,会给出明确错误提示。它适合轻量部署和已有阿里云百炼账号的场景;若需要物体检测、更精细的任务模式或其他平台能力,可能需要选择更专门的 Qwen-VL 技能。它不适合完全离线或无法配置 API Key 的环境。
使用场景
- 运维在值班群收到系统报错截图,需要提取错误信息并判断异常模块。
- 财务收到供应商发票照片,需要识别金额、税号与日期并生成核对表。
- 分析师把 K 线走势截图发给 Agent,需要总结趋势并指出关键点位。
- 客服收到菜单或公告牌照片,需要提取文字并整理成 Markdown 清单。
适合人员
- 使用 DeepSeek 等纯文本模型构建 Agent 的工程师,希望不更换主模型也能处理截图。
- 需要把聊天截图、发票照片或界面报错转成可检索文本的产品运营。
- 需要让脚本或 Agent 识别图表并输出结构化 Markdown 的数据分析同事。
- 已有阿里云百炼账号、希望轻量部署图片理解能力的个人开发者。