网页抓取与理解
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f12a44b7/web-scraper-cascade。
技能介绍
要解决的问题
网页抓取常面临结构不一致、JavaScript 渲染、反爬和付费墙。直接让模型读原始 HTML 成本高且不稳定。这个技能把任务拆成“先轻后重”的流水线,适合需要从文章、元数据或实体中抽取结构化数据的工程场景。
工作方式
- 规划先行:先确认目标 URL、内容类型、批量范围与输出格式,再检查依赖与目标页面响应。
- 五级流水线:从新闻/文章检测、HTTP 抓取、HTML 解析、Playwright 渲染到可选的 LLM 实体抽取。
- 配置驱动:使用
YAML维护 CSS 选择器与参数,生成Python脚本与JSON输出。 - 安全边界:默认只处理公开内容,使用
os.environ.get()读取密钥,避免绕过硬付费墙或未授权认证页面。
适用边界
它更适合文章、文档、公开数据页和实体抽取,不承诺绕过登录、付费墙或强反爬。Stage 5 需要 OPENROUTER_API_KEY,其他阶段通常无需凭证。若站点频繁改版,仍应监控选择器与输出质量。
使用场景
- 从公开文章页批量抽取标题、发布时间与正文,并输出统一 JSON。
- 检查站点是否需要 JS 渲染,再生成可复跑的 Playwright 抓取脚本。
- 用 YAML 维护 CSS 选择器,定期抽取公开文档页的元数据。
- 在脚本中对公开页面做实体抽取,失败时返回带 error 的 JSON。
适合人员
- 需要把公开网页结构化成 JSON 的数据工程师
- 要维护选择器并复跑抓取任务的爬虫工程师
- 需要从文章页抽取实体并容忍 LLM 失败的算法工程师
- 负责公开文档站点数据采集的分析师