Agent Skills
返回列表
Web 工具策略指南

Web 工具策略指南

知识管理 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_ec205dbb/web-tools-guide。

技能介绍

问题背景

在自动化 Web 数据获取任务中,开发者常遇到工具选择困境:何时用搜索引擎、直接抓取、命令行工具还是浏览器?错误选择可能导致请求失败、内容缺失或效率低下。该技能提供一套基于场景的决策策略,帮助在知识管理中可靠地处理 Web 内容。

核心能力与关键步骤

该技能遵循 ReAct 范式,将四个工具作为分支决策点,而非层级结构:

  • web_search:用于无明确 URL 时,搜索信息如新闻或资料。失败后按流程处理。
  • web_fetch:用于已知 URL 的静态内容,如文章或 API 端点。若返回错误,降级到其他工具。
  • opencli:作为 web_searchweb_fetch 失败后的首选后备,覆盖 70+ 主流网站,提供结构化数据。
  • browser:最后手段,用于 JS 渲染页面、登录态或交互操作,但需谨慎使用。

决策流程:

  1. 根据场景选择 web_searchweb_fetch
  2. 失败时,先尝试 opencli
  3. 仍失败则升级到 browser
  4. 每次切换工具时告知用户原因,避免静默降级。

关键操作指引:

  • 登录操作:必须获得用户授权,使用 well-known-sites.json 查找登录页 URL。
  • 页面交互:优先使用 CSS 选择器,智能等待元素出现,避免固定 sleep。
  • 失败处理:对于 web_search 失败,引导用户配置 API 密钥或降级到其他方案。

适用边界与注意点

该技能适用于标准 Web 数据获取,但有局限性:

  • 工具限制opencli 需先安装,覆盖主流网站但非万能;browser 工具重量级,应作为最后选择。
  • 安全考虑:登录和敏感操作需二次确认,CAPTCHA 可能无法自动处理。
  • 性能与状态:多步操作中复用浏览器上下文,避免重复打开;页面加载超时需设置合理阈值。

通过遵循此策略,开发者可以更系统地处理 Web 数据任务,减少错误和手动干预。

使用场景

  • 当需要从多个静态博客网站批量下载技术文档并解析内容时,使用 web_fetch 工具按 URL 直接获取,失败时切换到 opencli。
  • 在监控社交媒体热点时,通过 web_search 搜索关键词获取相关 URL,再根据决策流程选择后续工具深入获取数据。
  • 当访问需要登录的动态管理后台(如 CMS 系统)时,使用 browser 工具导航、填写凭证并执行数据导出操作。
  • 为竞品分析项目,从电商网站提取产品价格信息,先尝试 web_fetch 获取页面,若遇到 JS 渲染问题则降级到 browser 工具。

适合人员

  • 数据分析师:需要定期从 Web 源收集市场数据,并确保获取过程自动化以支持分析报告。
  • 内容编辑:负责监控行业新闻网站,及时提取文章内容更新到内部知识库。
  • 研究人员:从学术网站或博客中批量提取特定主题的文献资料,用于项目研究。
  • 运营专员:需要访问多个平台后台执行数据导出,但遇到动态页面或登录限制时需自动处理。