文章获取爬虫
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6ed3129a/capoocat。
技能介绍
要解决的问题
中文政策与新闻页面分散在多个政府站和新闻站,AI、数字化、信息化相关报道往往混在公告、采购、通知里。人工筛选时,需要反复打开站点、搜索关键词、排除无关内容,再整理链接和摘要。这个技能把这些站点访问、关键词过滤和输出整理成固定流程。
技能如何工作
- 来源覆盖:支持国家能源局、工业和信息化部、国家互联网信息办公室、国家发展和改革委员会、四川省经济和信息化厅、国家信息化专家咨询委员会,以及新华网、人民网、央视新闻、观察者网、澎湃新闻。
- 关键词过滤:优先保留
人工智能、数字化、信息化、AI、算法、大数据、云计算等主题,同时排除采购、公告、招标、中标、合同等噪声词。 - 输出结构:生成
original_articles/保存原文,article_links/保存链接与元数据,ai_summaries/保存摘要,crawled_links.json记录已爬链接用于去重。 - 运行特性:支持自动去重、按发布日期排序、增量文件索引、AI 内容摘要、错误处理和重试。
适用边界
它更适合做中文政府与新闻文章采集,不等同于通用全文网页抓取。若新增来源,需要按 BaseCrawler 扩展爬虫类并维护站点结构;关键词过滤是启发式规则,仍可能漏召回或误纳入边缘文章。
使用场景
- 跟踪国家部委官网中人工智能、数字化政策报道,并生成原文、链接与摘要文件。
- 从新华网、人民网等新闻站筛选 AI 与云计算文章,排除采购公告类噪声。
- 维护已爬链接记录,按发布日期排序并增量补充信息化主题文章。
- 为调研报告收集数字经济文章,输出结构化元数据与 AI 摘要。
适合人员
- 政策研究员:需要持续跟踪政府官网中人工智能、数字化、信息化报道并形成素材库。
- 数据分析师:要把新闻站文章按关键词过滤、去重并导出链接和摘要。
- 行业调研人员:需要从新华网、人民网等来源收集 AI 与数字经济文章用于报告。
- 爬虫维护者:需要扩展来源和关键词,并检查去重、排序与重试逻辑。