Agent Skills
返回列表
📊

网页抓取与理解

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f12a44b7/web-scraper-cascade。

技能介绍

要解决的问题

网页抓取常面临结构不一致、JavaScript 渲染、反爬和付费墙。直接让模型读原始 HTML 成本高且不稳定。这个技能把任务拆成“先轻后重”的流水线,适合需要从文章、元数据或实体中抽取结构化数据的工程场景。

工作方式

  • 规划先行:先确认目标 URL、内容类型、批量范围与输出格式,再检查依赖与目标页面响应。
  • 五级流水线:从新闻/文章检测、HTTP 抓取、HTML 解析、Playwright 渲染到可选的 LLM 实体抽取。
  • 配置驱动:使用 YAML 维护 CSS 选择器与参数,生成 Python 脚本与 JSON 输出。
  • 安全边界:默认只处理公开内容,使用 os.environ.get() 读取密钥,避免绕过硬付费墙或未授权认证页面。

适用边界

它更适合文章、文档、公开数据页和实体抽取,不承诺绕过登录、付费墙或强反爬。Stage 5 需要 OPENROUTER_API_KEY,其他阶段通常无需凭证。若站点频繁改版,仍应监控选择器与输出质量。

使用场景

  • 从公开文章页批量抽取标题、发布时间与正文,并输出统一 JSON。
  • 检查站点是否需要 JS 渲染,再生成可复跑的 Playwright 抓取脚本。
  • 用 YAML 维护 CSS 选择器,定期抽取公开文档页的元数据。
  • 在脚本中对公开页面做实体抽取,失败时返回带 error 的 JSON。

适合人员

  • 需要把公开网页结构化成 JSON 的数据工程师
  • 要维护选择器并复跑抓取任务的爬虫工程师
  • 需要从文章页抽取实体并容忍 LLM 失败的算法工程师
  • 负责公开文档站点数据采集的分析师