Windows 桌面操控
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_121462b9/desktop-control-win32。
技能介绍
解决的问题
Windows 上很多应用(WeChat、QQ、Electron)用 CEF/Chromium 渲染,不是标准 Win32 控件;pyautogui.click() 常因焦点或命中区域不稳而失败。这个技能针对“截图 → 视觉理解 → 点击/输入 → 再截图验证”的桌面闭环,处理可见窗口中的按钮、输入框、聊天消息等任务。
工作方式与适用边界
- 截图:先抓取窗口或全屏画面。
- 视觉解析:用
GLM-4V-Flash问百分比位置,避免让 VLM 直接读像素坐标。 - 控制:用
win32api.SetCursorPos、mouse_event、keybd_event做低层点击和按键。 - 文本输入:短 ASCII 可用
pyautogui.write();中文或 emoji 用剪贴板Ctrl+V,减少输入法干扰。 - 验证:每次动作后截图并让视觉模型确认。
注意它不适合终端、文件 I/O 或网页抓取;窗口句柄可能失效,Enter 行为因应用设置而异,焦点可能被抢占,因此需要延时、重枚举窗口和最终截图核验。
使用场景
- 在 Windows 聊天窗口中定位输入框,发送短消息并截图确认已发出。
- 对 CEF 应用按钮点击失败时,改用 win32api 按视觉模型给出的百分比位置执行点击。
- 填写桌面应用表单时,用剪贴板粘贴中文或 emoji,避免输入法导致内容错乱。
- 在 QQ 或 Electron 应用中完成点击、输入、提交动作,并用后续截图核验结果。
适合人员
- 维护桌面脚本、常需在 WeChat 或 QQ 里自动发消息或点击按钮的自动化工程师。
- 做 GUI 测试、要稳定验证 Electron 或 CEF 应用点击结果的测试工程师。
- 处理 Windows 办公流程、希望把截图理解与键鼠控制接进 Agent 的工作流开发者。
- 研究多模态 Agent、需要用视觉模型定位界面元素并执行低层控制的算法工程师。