Ego 浏览器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_57645b9d/ego-browser。
技能介绍
解决什么问题
Web automation 给 AI Agent 带来一个常见断层:Agent 侧需要执行脚本、等待、记录日志并管理任务状态;浏览器侧则需要访问 document、window、真实视口和页面 JavaScript。ego-browser 为 AI Agent 提供一个 CLI 可访问的 Node.js 运行时,并内置 snapshot、click、evaluate、cdp 等 helper,使 Agent 可以在同一个脚本工作流中观察页面、操作 UI、执行浏览器端 JavaScript,并驱动真实浏览器完成 Web 自动化任务。
如何工作
通过 Bash tool 以 ego-browser nodejs { ... })() 形式运行浏览器操作。heredoc 主体是 Node.js 代码:导航、等待、console.log(...) 和任务空间管理应写在这里;任何需要页面上下文的内容,例如 document、window、CSS 选择器或浏览器 JavaScript,都应放进 evaluate(...)。一个典型流程是:先用 snapshot 或 pageInfo() 检查页面状态,判断坐标是否可用,再执行 click 或 evaluate,最后调用 completeTaskSpace(name, { keep }) 结束任务。默认使用 { keep: false },只有明确的 live-page 场景才使用 { keep: true }。
注意点
- 如果
await pageInfo()报告w: 0或h: 0,先停止坐标操作和截图,直到视口修复;可切换真实标签页、重载页面或检查 CDP viewport metrics,再用pageInfo()和screenshot()验证。 - 行尾的
[ego-browser:notice]是更新提示,不是错误。不要在任务中途处理它;当前任务停止或completeTaskSpace()完成后,再询问是否升级并重启ego lite。 - 默认假设运行时已准备好,除非首次运行报错。如果首次运行提示
command not found或缺少环境,按安装流程处理后再回到原始任务。
使用场景
- 让 Agent 登录后台后提取列表页数据,并调用 evaluate 读取 DOM。
- 在坐标点击前用 snapshot 和 pageInfo 确认页面视口不为零。
- 用 click 触发筛选条件,再在 evaluate 中读取 document 选择器结果。
- 任务结束后调用 completeTaskSpace,默认 keep false 清理空间。
适合人员
- 需要让 Agent 在真实浏览器中点击、读取 DOM 的工程师
- 要把页面数据抽给脚本或下游系统处理的自动化研发
- 需要在 Agent 里执行浏览器端 JavaScript 的应用开发者
- 要完成登录、筛选、状态读取等 Web 流程的平台团队