AI-Eyes 屏幕视觉插件 2.0
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_09a38a2b/dgjh。
技能介绍
要解决的问题
文字型 AI 通常只能理解可见文本,遇到图形按钮、图标、状态栏、悬浮提示或密集控件时,容易把“在哪个像素”这件事说错。屏幕操作需要把元素定位从经验判断变成可检查、可复现的流程。
工作方式
- 视觉金字塔:从
L0全屏扫描到L3微观区域,逐层放大候选区域,将定位精度推进到0.125px。 - 候选筛选:支持
exact、fuzzy、semantic、position四种模式,可按精确文本、模糊字符、语义近似或屏幕位置加权缩小范围。 - 坐标校正:坐标变换器会补偿放大比例,使返回结果是真实屏幕坐标,而不是裁剪图或中间图层坐标。
- 可选验证:连接
Ollama与LLaVA后,对候选元素进行视觉语言模型二次确认,减少 OCR 误读和形近字符问题。
适用边界
该能力依赖 Pillow、rapidocr-onnxruntime 或 easyocr,截图来源可用 pyautogui 替换。若界面以图标为主、文字稀疏、截图模糊或分辨率极高,建议切换到 L2/L3 层级并启用语义验证。
使用场景
- 给桌面自动化脚本定位按钮、输入框等 UI 元素,并返回可点击的真实屏幕坐标
- 在模糊文案或同义按钮场景下,用 `semantic` 模式找到“提交/确认/OK”等控件
- 处理密集工具栏或极小图标时,切换到 `L2/L3` 层级做精细定位与候选筛选
- 用坐标变换器校正放大比例,把候选区域坐标转换成真实屏幕坐标用于后续操作
适合人员
- 写 RPA 或 UI 自动化的工程师,需要稳定定位屏幕控件并获取真实坐标
- 做桌面 GUI 测试的工程师,需要按 `exact`、`fuzzy`、`semantic` 模式验证元素存在
- 构建多模态 Agent 的工程师,需要把 OCR 或 `LLaVA` 候选结果转换为可操作坐标
- 维护本地视觉工作流的工程师,需要可选接入 `Ollama` 与 `LLaVA` 做二次确认