Agent Skills
返回列表
网页抓取工具箱

网页抓取工具箱

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f28fdad8/oc-web-fetch。

技能介绍

问题

抓取网页内容给 LLM 或分析管道使用时,直接 requests + BeautifulSoup 往往要处理编码、正文噪声、批量去重、元素提取和 Markdown 化。@user_f28fdad8/oc-web-fetch 把这些步骤收敛成四个脚本:单 URL 抓取、批量抓取、选择器提取、HTML 转 Markdown。

工作方式

fetch.py 发起 HTTP 请求,做编码检测和正文提取,输出标题、正文与元信息;batch_fetch.py 用并发队列抓取多个 URL,并给出成功/失败数、耗时等汇总;extract.py 支持 tag、class、id、attr 选择器,只返回匹配文本或属性;to_markdown.py 去除导航、广告、脚本和样式,保留标题、段落、列表、链接与图片,转成干净 Markdown。整体输入输出尽量 JSON 化,便于 Agent 或下游程序直接消费。

注意点

它适合静态页面或普通 HTML 正文提取,依赖文本密度算法过滤噪声,不适用于强反爬、登录态、JavaScript 渲染或复杂交互场景。批量抓取默认并发和延迟较保守,生产使用时应自行评估目标站 robots、速率限制与合规边界。

使用场景

  • 抓取竞品官网单页,提取标题、正文与元信息,转成 Markdown 供模型分析
  • 并发抓取多个来源 URL,生成成功失败数与耗时汇总报告,筛选有效页面
  • 根据 class/id 选择器提取目标区块,得到匹配文本或属性列表供入库
  • 把旧系统 HTML 页面去噪并转 Markdown,保留标题、列表、链接和图片

适合人员

  • 维护 RAG 知识库的工程师:把公开文档网页抓成干净 Markdown 与 JSON
  • 做数据调研的分析员:并发抓取多个 URL,汇总成功失败数与耗时
  • 前端或爬虫工程师:按 class/id 选择器提取目标区域内容
  • 写报告的数据记者:把新闻网页去噪后转为可编辑 Markdown