Agent Skills
返回列表
📊

Firecrawl 网页数据抓取

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_b22a52ba/firecrawl。

技能介绍

要解决的问题

Firecrawl 面向的是 AI Agent 在处理网页时常见的几类摩擦:目标页面可能是带大量标签和脚本的 HTML,直接喂给模型既贵又噪声大;要找的信息又常常分散在搜索结果、子页面和整站文档里;静态抓取之外,还需要知道页面是否发生过变化。该技能把网页交互收敛为一组 API 调用,让 Agent 能先定位、再读取、最后把内容整理成适合推理或分析的格式。

技能如何工作

它围绕五个端点组织核心流程:

  • Search:用 POST /v2/search 在互联网中查找候选页面,并返回包含页面内容的结果列表。
  • Scrape:对单个 URL 调用 POST /v2/scrape,输出 Markdown、结构化数据或截图。
  • Map:通过 POST /v2/map 获取站点可抓取 URL,帮助判断网站结构。
  • Crawl:用 POST /v2/crawl 批量爬取整站,适合需要异步轮询的大规模抓取。
  • Monitor:通过 POST /v2/monitor 跟踪页面变化,并在变动时触发通知。

实际使用时,通常先用 Search 发现来源,再用 Scrape 深入提取;如果目标是整站资料,则先 Map 确认范围,再 Crawl。对于需要精确字段的页面,可以配合 extract 参数和 prompt 生成结构化数据。

适用边界

它适合需要干净网页文本、结构化字段和站点级抓取的任务,但不保证绕过所有反爬策略。调用会消耗 credits,Crawl 是异步操作,需要轮询结果;返回的 Markdown 可能包含目标网站使用的占位符或混淆内容。API Key 应通过环境变量传入,不宜硬编码在脚本里。

使用场景

  • 排查竞品官网改版时,用 Monitor 跟踪目标页面并收到变更提醒。
  • 整理行业报告时,先 Search 定位来源,再 Scrape 提取正文 Markdown。
  • 需要汇总站点资料时,用 Map 确认 URL 范围后再 Crawl 整站。
  • 从产品详情页提取价格与规格时,使用 extract 生成结构化字段。

适合人员

  • 构建 AI Agent 的工程师,需要把网页转成 Markdown 或结构化数据。
  • 做竞品情报的分析人员,需要监控目标页面并发现内容变化。
  • 整理站点文档的研究人员,需要 Map 和 Crawl 批量获取可用 URL 与正文。
  • 调用外部数据源的后端工程师,需要按 Bearer API Key 请求 Firecrawl 端点。