Agent Browser 浏览器自动化
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a994e44e/agent-browser-plus。
技能介绍
它解决什么问题
agent-browser 面向需要让 AI Agent 与真实浏览器交互的场景。相比直接维护脆弱选择器,它先把页面状态转成可解析的快照,再用 @e1、@e2 这类 ref 定位元素,减少 CSS、XPath 或硬编码结构带来的失败概率。适合表单提交、登录态复用、多标签页、截图、PDF、Cookie 状态、网络检查和调试等任务。
核心工作方式
典型流程是:
agent-browser open <url>打开页面agent-browser snapshot -i生成带 refs 的元素列表- 根据 snapshot 中的 ref 执行点击、填充、选择等交互
- 页面导航或 DOM 明显变化后重新 snapshot
技能还提供:
- 状态管理:保存和复用 Cookie 与 storage,用于鉴权或登录态
- 并行会话:通过
--session隔离浏览器上下文 - 机器可读输出:
--json便于程序解析 - 调试能力:
--headed显示窗口、--timeout控制超时、--cdp连接 DevTools 协议 - 页面能力:截图、PDF、视频录制、鼠标控制、Frames、Dialogs、JavaScript、Network、Tabs 等
注意:
- refs 随页面加载变化,导航后必须重新 snapshot
- 输入框优先使用
fill,避免残留文本 - 元素未找到时先检查 snapshot;页面未加载时增加
wait
使用场景
- 测试工程师验证网页表单时,用页面快照取得输入框引用并填写提交。
- 自动化工程师需要登录态时,保存 Cookie 与存储状态并在后续任务复用。
- 产品验收页面流程时,用多标签页、框架和弹窗检查复杂浏览器场景。
- 数据工程师抓取页面信息时,用 JSON 输出和页面状态检查把结果交给后续程序。
适合人员
- 负责网页端 UI 回归的测试工程师,希望减少选择器维护并稳定定位元素。
- 做自动化验收的产品工程师,需要打开多标签页、弹窗和框架页面完成检查。
- 构建 AI Agent 应用的工程师,要把浏览器操作结果解析成程序可消费的 JSON。
- 需要复现登录态的运维工程师,要保存 Cookie 与存储状态供后续任务使用。