浏览器自动化工具箱
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_7495c5ed/browser-automation-toolbox。
技能介绍
问题背景
浏览器自动化在数据采集和测试中常遇到反爬机制、登录态维持、SPA 动态内容抓取等挑战。具体问题包括:
- 反检测:如
Playwright被风控拦截,自动化指纹暴露。 - 登录态丢失:在爬取需要登录的平台时,会话失效导致数据不完整。
- SPA 抓取不全:单页应用的动态加载内容难以通过静态解析获取。
- 维护成本高:多平台 selector 变化频繁,手动更新耗时。
- AI 平台特殊处理:如豆包、GPT 等平台的登录和反爬机制更严格。
核心能力与工作流程
Browser Automation Toolbox 通过智能降级策略解决上述问题,其核心工作流程如下:
引擎自动降级
工具箱内置 4 套浏览器引擎,按优先级自动切换以确保任务成功率:
CloakBrowser:本地反检测浏览器,适合真实网站和敏感页面。browser-act:云端浏览器池,提供会话管理和人机协作。Kimi WebBridge:在特定失败场景下,通过浏览器插件辅助。Playwright:作为兜底方案,用于标准测试和简单页面。
例如,执行时先尝试 CloakBrowser,若失败则降级到 browser-act,以此类推。默认 max_attempts_per_engine 为 2,仅在瞬时失败时增至 3。
平台感知优先级
针对不同平台,工具动态调整引擎顺序以优化成功率:
- 小红书 (Xiaohongshu):优先使用
browser-act,因其云端池绕过反爬更稳定。 - AI 平台 (Gemini、豆包、GPT):优先
CloakBrowser,避免云端浏览器丢失本地登录 cookie。 - B站、抖音、微博:默认
CloakBrowser优先,利用持久化 profile。
用户可通过 --platform 参数指定平台,或由工具自动检测域名。用户偏好(如优先用 browser-act)可被记录并覆盖默认顺序。
关键步骤支持
- 登录与验证码处理:遇到登录墙时,暂停引擎并请用户手动完成,再恢复或切换引擎。公开爬取默认用可见浏览器模式。
- SPA 无限滚动:针对 B站、小红书、抖音,采用滚动轮次采集;微博实时搜索优先 URL 分页参数。
- 经验沉淀:运行中发现的 selector 变化或策略调整会记录到
references/platform-scraping-patterns.md,便于复用。
适用场景与注意事项
适合场景
- 网页爬取与数据采集,尤其是公开舆情监控。
- 表单自动填写和截图取证。
- AI 平台的自动化交互,如内容生成和思维链检测。
- 评估并增强其他浏览器自动化 skill。
注意事项
- 引擎选择:默认优先级可能因平台而异,需根据目标站点调整。用户始终可用
--engine-order ...强制指定顺序。 - 登录态维护:对于需要登录的站点,优先使用
CloakBrowser的持久化 profile,避免 cookie 丢失。 - 失败处理:工具会保存错误日志和截图,但仅在同一引擎多次失败后才切换,避免无止境重试。
- 互补工具:当任务仅需复用用户已登录浏览器且无反爬时,推荐使用
BrowserSkill(Tencent),而非本工具箱的降级链。 - Skill 评估:工具可评估其他 skill 的浏览器自动化能力,并提供差距报告与合入建议,但需用户触发。
使用场景
- 每周需爬取小红书、抖音等平台的公开笔记,进行舆情趋势分析,传统爬虫频繁被风控拦截。
- 在AI平台(如豆包、GPT)上自动化执行内容生成或数据提取任务,遇到登录墙和严格反爬机制。
- 自动化填写网页表单并提交,用于批量数据收集,需处理验证码和登录态维持。
- 对SPA应用(如B站)进行无限滚动采集,获取完整评论或动态内容,selector易漂移。
适合人员
- 数据分析师:需定期爬取社交媒体数据进行市场趋势分析,但手动操作耗时且反爬难度高。
- 合规监控专员:负责监控公开舆情以捕捉负面信息,要求稳定采集且能处理登录态。
- 自动化测试工程师:测试网页表单和SPA应用的功能,需要模拟用户交互并处理验证码。
- AI研究员:在豆包或GPT平台上自动化执行实验任务,需绕过风控并维持登录会话。