Agent Browser 无头浏览器自动化
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f12a44b7/self-dev-agent-browser。
技能介绍
解决的问题
当脚本需要操作网页时,CSS 选择器易碎、页面异步加载会导致等待困难,自动化也常依赖有界面环境。agent-browser 将无头浏览器变成可命令式驱动的对象:先导航,再用快照定位,最后按引用执行交互。它适合把表单提交、登录态复用、截图/PDF、网络观察等流程写成可解析的 CLI 工作流。
技能如何工作
核心循环是:
open打开目标页;snapshot -i返回带@e1、@e2这类引用的元素;- 用引用执行点击、输入、等待、鼠标控制;
- 页面跳转或 DOM 显著变化后重新
snapshot。
除基础交互外,还提供 cookies/storage、network、tabs、frames、dialogs、JavaScript、状态管理和并行 --session。输出可加 --json,便于程序读取。--headed 可用于调试,--cdp 可连接 Chrome DevTools Protocol。
注意边界
- refs 仅在当前页面加载期间稳定,导航后会变化;
- 输入框建议用
fill而非type,确保清空原有内容; - 页面未加载时应在导航后加
wait; - 录像会创建新上下文,但保留当前 session 的 cookies/storage。
使用场景
- 在 CI 中打开表单页,用 snapshot 取引用并提交数据,再输出 JSON 结果。
- 需要复用登录态时,保存 cookies/storage,并用并行 session 批量执行任务。
- 页面跳转后元素引用失效,重新 snapshot 再定位输入框、按钮和表格。
- 用 --headed 调试无头失败,再用 --json 和 wait 稳定抓取页面状态。
适合人员
- 需要把网页操作写成可解析 CLI 命令的后端工程师
- 要在 CI 里稳定提交表单、抓页面状态的自动化测试工程师
- 需要复用登录态和并行浏览器会话的爬虫/数据工程师
- 调试无头浏览器交互并输出截图/PDF 的前端工具链开发者