计算机操作代理
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/computer-use-agents。
技能介绍
问题:桌面自动化不是普通 API 调用
计算机操作代理要解决的是模型只能“看懂界面”,还不能稳定“完成操作”的问题。屏幕状态复杂,UI 元素位置可能变化,输入、点击、滚动、文件编辑会相互影响,如果代理直接在主机上运行,误操作、凭据泄露或资源耗尽都会造成实际损失。该技能关注的核心问题,是把视觉模型与桌面控制整合成可测试、可约束的闭环。
工作方式:感知、推理、行动、反馈
技能将 computer use agent 描述为 Perception-Reasoning-Action Loop:先用 screenshot 捕获当前屏幕,再由视觉语言模型判断下一步,再通过 mouse、keyboard、bash、text_editor 等工具执行动作,最后根据结果继续或纠正。资料还提到 Anthropic computer use 的不同工具版本:computer_20251124 面向 Opus 4.5,新增 zoom 用于细节查看;computer_20250124 提供标准桌面控制能力。工程侧需要把环境隔离作为前提,限制网络、文件系统、凭据、系统调用和资源,确保代理出错时“爆炸半径”可控。
适用边界与注意点
适合用于从零构建桌面操作代理、理解代理行为模式,或把视觉模型与桌面控制集成到测试环境。注意它并不保证对所有 UI 都稳定:Anthropic 文档提到下拉框、滚动条等元素可能较难操作。实践上应优先使用键盘替代方案、控制上下文长度、监控成本,并在高风险动作前加入确认或人工干预。资料也把沙箱化、纵深防御和拟人化随机性列为处理风险的方向。
使用场景
- 在 Docker 虚拟桌面中构建 Claude computer use 代理,完成截图、点击、输入和文件编辑的闭环测试。
- 为桌面自动化任务设计沙箱限制,约束网络、文件系统、凭据、系统调用与 CPU、内存和时间。
- 排查 Claude 对下拉框、滚动条等 UI 操作不稳的问题,改用键盘或 `text_editor` 完成任务。
- 将视觉语言模型接入桌面控制工具,实现观察屏幕、规划动作、执行 `bash` 或编辑文件的流程。
适合人员
- 负责桌面自动化 POC 的 AI 工程师,需要把 Claude 视觉模型接入鼠标键盘与文件编辑工具。
- 做安全运行的平台工程师,需要为不可信自动化任务配置 Docker 沙箱、网络与凭据隔离。
- 构建 UI 操作代理的研究工程师,需要分析截图、推理、行动、反馈循环和代理停顿模式。
- 负责生产代理运维的工程师,需要限制上下文、成本、资源,并处理下拉框等 UI 操作风险。