Agent Skills
返回列表
网页数据采集助手

网页数据采集助手

数据分析 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_b4da0893/web-scraping-helper-cn。

技能介绍

要解决的问题

网页采集常常卡在“拿到 URL 之后怎么办”:字段定义不清、选择器不稳定、列表翻页重复、空值异常难查,以及多人协作时无法验收。这个技能面向市场研究、运营、产品和数据人员,把公开页面的采集目标转换成可执行、可检查的交付物,而不是只给原则性建议。

工作方式和核心能力

它会按任务输出 理解确认、可用成品、判断依据、验收清单和下一步。核心能力包括:

  • 采集规划:从 URL 范围 和字段表出发,明确需要采集的产品页、列表页或详情页。
  • 页面解析:给出标题、价格、参数等字段的选择规则与兜底策略。
  • 翻页去重:处理列表页完整采集,输出翻页策略和去重键。
  • 质量检查:检查空值、重复、异常值和字段缺失。
  • 更新监控:根据抓取频率和变更字段发现页面变化。

关键步骤通常是先确认数据公开可访问且允许合理使用,再限定域名、页面类型、频率和字段,用少量样本验证解析规则,最后加入去重、重试、限速、失败日志,并抽样对照原页面标注采集时间。

适用边界和注意点

它不绕过登录、验证码、付费墙、robots 限制或访问控制,也不采集个人隐私、敏感身份信息或非公开数据。若请求超出边界,应说明不能直接完成的部分,并给出合规替代步骤、准备材料或人工接管点。适合已有目标素材、希望获得可检查脚本和验收标准的场景,不适合要求绕过平台限制或批量抓取受保护内容。

使用场景

  • 为竞品调研规划商品列表页字段、URL 范围和翻页去重规则。
  • 提取详情页的标题、价格、规格参数,并给出选择规则与兜底。
  • 检查采集结果中的空值、重复项和异常价格,形成验收清单。
  • 监控商品页字段变化,设定抓取频率和需要关注的变更字段。

适合人员

  • 做竞品价格调研、需要规划字段表和翻页去重规则的市场研究员
  • 负责商品库维护、需要提取详情页标题价格规格并兜底的运营
  • 维护结构化数据、需要空值重复异常检查的产品人员
  • 执行公开数据采集、需要验收清单和失败可见性的数据工程师