Agent Skills
返回列表
XScrapy AI 原生通用爬虫引擎

XScrapy AI 原生通用爬虫引擎

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e263a450/x-scrapy。

技能介绍

解决的问题

网页结构没有统一规范,价格、新闻、帖子、文档等页面字段分散,手工写 XPath/CSS 规则成本高,动态页面还会漏数据。x-scrapy 针对“给定 URL 后快速拿到结构化数据”的问题,将页面类型识别、字段模板、规则提取和可选 AI 提取合并成一条流程,减少为每个页面单独适配的样板工作。

如何工作

核心流程包括:

  • 输入 URL 后自动识别页面类型,并匹配 ecommerce、news、social、forum、docs、listing 等场景模板。
  • 按模板提取字段,如电商页的 title、price、in_stock、specs,文章页的 title、author、article_body。
  • 支持 CLI、Python API 和单页快速提取,并可配置代理、反检测参数与 JS 渲染。
  • 规则不足时启用 AI 提取:先分析页面语义结构,再提取指定字段,补充规则遗漏信息,并返回带 confidence_score 的结果。

适用边界

  • 适合列表页、详情页、资讯页、文档页等结构化提取任务,输出标准 JSON,便于后续入库或分析。
  • SPA、AJAX 等动态页面需要启用 JS 渲染能力,否则可能只拿到骨架 HTML。
  • AI 模式会产生外部 API 调用费用,应仅在规则无法覆盖时使用。
  • 每条数据附带置信度,低置信度字段建议人工复核;同时需遵守目标站点 robots.txt 与使用条款。

使用场景

  • 电商竞品分析:抓取多个商品详情页的标题、价格、库存和规格,输出 JSON 便于对比。
  • 新闻聚合:从指定新闻页批量提取标题、作者、发布时间和正文,生成标准 JSON。
  • 技术文档采集:抓取 API 文档页面的章节、代码块和内部链接,整理成结构化数据。
  • 论坛内容监控:抓取帖子标题、作者、正文和评论数,用于后续趋势分析。

适合人员

  • 做竞品价格监控的数据分析师:每天从多个电商页提取价格、库存和商家字段。
  • 维护资讯聚合站的内容运营:批量抓取新闻和博客页的标题、作者、正文与标签。
  • 构建知识抽取流水线的后端工程师:把文档页的章节、代码块和链接转成 JSON 入库。
  • 做爬虫策略的 Web 数据工程师:配置代理、JS 渲染和 AI 提取,处理复杂页面。