浏览器自动化代理
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/browserskill。
技能介绍
问题背景
浏览器自动化任务常需操作用户已登录的页面,例如填表、测试 UI 或抓取数据,但直接控制浏览器窗口可能干扰正常浏览或暴露敏感信息。传统方案在隔离环境(如无头浏览器)中运行,丢失了用户会话上下文,需要重新登录,效率低下。
核心工作原理
BrowserSkill 通过 bsk CLI 和 Chromium 扩展驱动用户的真实浏览器,在隔离的 Agent Window 中执行自动化,而用户的正常窗口保持独立。核心流程包括:
- 会话管理:使用
bsk session start创建会话,打开 Agent Window;任务结束后必须调用bsk session stop清理。 - 观察优先级:默认使用
bsk snapshot获取页面结构和@eN元素引用,仅当快照不足时升级到bsk get-html或bsk screenshot。 - 交互循环:在 Agent Window 中通过
bsk click、bsk fill等命令操作元素,引用来自最新快照。对于用户标签页,需先通过bsk tab borrow借用到 Agent Window 才能写入。 - 安全边界:所有写操作仅限于 Agent Window 或借用标签;脚本执行 (
bsk evaluate) 仅在 Agent 标签中允许,避免跨域风险。
关键步骤示例:定义成功目标后,执行快照→操作→检查的紧凑路径,避免冗余探索。遇到验证码或登录时,使用 bsk request-help 暂停并请求用户介入。
使用注意事项
- 适用场景:需用户真实浏览器上下文的任务,如自动化多步表单、UI 冒烟测试,或基于用户操作轨迹(trace.json)的重放。
- 禁止行为:不得在银行、SSO 或密码管理器页面运行
bsk evaluate提取凭据;不得长期借用用户标签页;任务达标后立即停止会话,不进行额外验证。 - 错误处理:根据退出代码(如 1 表示参数错误、4 表示超时)使用
bsk doctor诊断;导航后引用失效,需重新快照。 - 录制功能:通过
bsk record捕获用户在 Agent Window 的操作为 trace.json,供后续自动化参考,但避免录制敏感页面。
使用场景
- 测试工程师需要验证一个新功能上线后,核心表单流程(如注册、结账)在真实用户环境下的 UI 交互是否正常。
- 数据分析师需要从一个需要登录的内部报表网站中,定期抓取最新的销售数据表格,用于生成周报。
- 前端开发者需要复现并调试用户报告的一个页面特定交互 bug,该 bug 发生在用户自己的已登录会话中。
- 运维人员需要在一个复杂的 SaaS 平台上,自动化执行一系列预配置的设置检查,以确保服务状态正常。
适合人员
- 负责 Web 应用质量保障的测试工程师,需要高效、真实地执行重复性 UI 测试用例。
- 需要从受认证保护的网站或内部系统中提取结构化数据进行分析的数据分析师或业务运营。
- 需要远程协助用户解决浏览器端问题、或需要基于真实环境进行调试的开发与技术支持人员。
- 寻求通过脚本化操作简化复杂 Web 平台配置或数据采集任务的 DevOps 或效率工程师。