XScrapy AI 原生通用爬虫引擎
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e263a450/x-scrapy。
技能介绍
解决的问题
网页结构没有统一规范,价格、新闻、帖子、文档等页面字段分散,手工写 XPath/CSS 规则成本高,动态页面还会漏数据。x-scrapy 针对“给定 URL 后快速拿到结构化数据”的问题,将页面类型识别、字段模板、规则提取和可选 AI 提取合并成一条流程,减少为每个页面单独适配的样板工作。
如何工作
核心流程包括:
- 输入 URL 后自动识别页面类型,并匹配
ecommerce、news、social、forum、docs、listing等场景模板。 - 按模板提取字段,如电商页的
title、price、in_stock、specs,文章页的title、author、article_body。 - 支持 CLI、Python API 和单页快速提取,并可配置代理、反检测参数与 JS 渲染。
- 规则不足时启用 AI 提取:先分析页面语义结构,再提取指定字段,补充规则遗漏信息,并返回带
confidence_score的结果。
适用边界
- 适合列表页、详情页、资讯页、文档页等结构化提取任务,输出标准 JSON,便于后续入库或分析。
- SPA、AJAX 等动态页面需要启用 JS 渲染能力,否则可能只拿到骨架 HTML。
- AI 模式会产生外部 API 调用费用,应仅在规则无法覆盖时使用。
- 每条数据附带置信度,低置信度字段建议人工复核;同时需遵守目标站点
robots.txt与使用条款。
使用场景
- 电商竞品分析:抓取多个商品详情页的标题、价格、库存和规格,输出 JSON 便于对比。
- 新闻聚合:从指定新闻页批量提取标题、作者、发布时间和正文,生成标准 JSON。
- 技术文档采集:抓取 API 文档页面的章节、代码块和内部链接,整理成结构化数据。
- 论坛内容监控:抓取帖子标题、作者、正文和评论数,用于后续趋势分析。
适合人员
- 做竞品价格监控的数据分析师:每天从多个电商页提取价格、库存和商家字段。
- 维护资讯聚合站的内容运营:批量抓取新闻和博客页的标题、作者、正文与标签。
- 构建知识抽取流水线的后端工程师:把文档页的章节、代码块和链接转成 JSON 入库。
- 做爬虫策略的 Web 数据工程师:配置代理、JS 渲染和 AI 提取,处理复杂页面。