Agent Skills
返回列表
文章获取爬虫

文章获取爬虫

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6ed3129a/capoocat。

技能介绍

要解决的问题

中文政策与新闻页面分散在多个政府站和新闻站,AI、数字化、信息化相关报道往往混在公告、采购、通知里。人工筛选时,需要反复打开站点、搜索关键词、排除无关内容,再整理链接和摘要。这个技能把这些站点访问、关键词过滤和输出整理成固定流程。

技能如何工作

  • 来源覆盖:支持国家能源局、工业和信息化部、国家互联网信息办公室、国家发展和改革委员会、四川省经济和信息化厅、国家信息化专家咨询委员会,以及新华网、人民网、央视新闻、观察者网、澎湃新闻。
  • 关键词过滤:优先保留 人工智能、数字化、信息化、AI、算法、大数据、云计算 等主题,同时排除 采购、公告、招标、中标、合同 等噪声词。
  • 输出结构:生成 original_articles/ 保存原文,article_links/ 保存链接与元数据,ai_summaries/ 保存摘要,crawled_links.json 记录已爬链接用于去重。
  • 运行特性:支持自动去重、按发布日期排序、增量文件索引、AI 内容摘要、错误处理和重试。

适用边界

它更适合做中文政府与新闻文章采集,不等同于通用全文网页抓取。若新增来源,需要按 BaseCrawler 扩展爬虫类并维护站点结构;关键词过滤是启发式规则,仍可能漏召回或误纳入边缘文章。

使用场景

  • 跟踪国家部委官网中人工智能、数字化政策报道,并生成原文、链接与摘要文件。
  • 从新华网、人民网等新闻站筛选 AI 与云计算文章,排除采购公告类噪声。
  • 维护已爬链接记录,按发布日期排序并增量补充信息化主题文章。
  • 为调研报告收集数字经济文章,输出结构化元数据与 AI 摘要。

适合人员

  • 政策研究员:需要持续跟踪政府官网中人工智能、数字化、信息化报道并形成素材库。
  • 数据分析师:要把新闻站文章按关键词过滤、去重并导出链接和摘要。
  • 行业调研人员:需要从新华网、人民网等来源收集 AI 与数字经济文章用于报告。
  • 爬虫维护者:需要扩展来源和关键词,并检查去重、排序与重试逻辑。