网页抓取与内容理解
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f12a44b7/cnbll-self-dev-web-scraper 到当前 AI 助手中。
技能介绍
问题
抓取网页内容时常卡在“怎么拿、怎么洗、怎么用”。直接拿 HTML 塞给模型会浪费 token 且实体抽取噪声大;纯正则又难覆盖正文、标题、作者、日期等自然内容;批量爬取还容易遇到反爬、限流、编码和断点丢失。
技能如何工作
它把任务拆成可审计的 Python 脚本、YAML 配置和 JSON 输出:先用轻量 HTTP 与页面特征判断是否为文章页,再按需进入正文清洗、批量爬取、Playwright 渲染和 LLM 实体抽取。LLM 只处理已清洗文本,不直接解析原始 HTML;CSS 选择器尽量放入配置,便于换站维护。
适用边界
适合公开网页、文章正文、元数据和简单实体抽取;不适合绕过硬付费墙、认证页或未授权登录场景。需要遵守 robots.txt、限速和编码检查;若使用可选的实体抽取阶段,需要在运行脚本环境中配置 OPENROUTER_API_KEY,而不是把密钥写入代码。
使用场景
- 需要从多个公开新闻站点批量提取文章正文与标题,并输出 JSON 供下游分析。
- 把行业报告网页的元数据、发布时间、作者抽成结构化字段,便于入库和对比。
- 用 Playwright 渲染动态页面,从公开商品页获取名称、价格、规格等字段。
- 在清洗后的文章文本上抽取实体,生成带错误兜底的 JSON 结果。
适合人员
- 需要把公开网页正文清洗成可分析文本的数据工程师
- 要做竞品公开页面信息采集与结构化比对的产品分析师
- 需要批量处理新闻或博客文章元数据的爬虫脚本维护者
- 需要在干净文本上补充实体抽取的信息系统开发人员