头条文章阅读器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_09d1a78f/toutiao-article-reade。
技能介绍
解决的问题
长文阅读工具经常卡在“能打开但读不准”:头条、微信公众号、知乎和雪球等页面结构不同,正文里混有广告、水印、推荐卡片,直接抓取 HTML 容易得到一堆噪声,人工复制粘贴又难以沉淀成可分析的结构。toutiao-article-reader 面向这类场景,目标是把一篇公开文章整理成标题、作者、发布时间、正文和摘要,方便后续分析或二次使用。
工作方式与适用边界
技能通常按平台识别规则启动 playwright,打开文章页并等待关键内容渲染,再用 beautifulsoup4 解析标题、作者、时间和正文。识别平台后会套用对应提取策略,对广告、无关模块做清洗,最后交给 AI 生成摘要并输出结构化报告。流程上适合“给链接—读文章—总结/分析”的使用方式。
需要注意边界:它依赖真实浏览器加载页面,首次运行会下载 Chromium,访问速度比普通请求慢,通常约 5~10 秒;需要登录、权限受限或反爬较强的文章可能无法读取;对“其他平台”使用通用规则,准确率和完整度可能低于头条、公众号、知乎、雪球等已优化平台。
使用场景
- 收到知乎技术文章链接,需要快速提取标题、作者、发布时间和正文,整理成分析底稿。
- 需要把一篇微信公众号长文去广告和水印,再用 AI 总结成可转述的要点。
- 对比今日头条和雪球上的多篇公开文章,先获取正文与字数统计,再写来源比较。
- 处理一篇公开长文,要求生成结构化报告,包括标题、作者、时间、正文摘要。
适合人员
- 技术内容运营:每天要看竞品公众号和知乎文章,需要快速抓取正文并总结。
- 分析师:要收集头条、雪球公开长文作为研究材料,需要标题、作者、时间和正文。
- 产品研究:需要清洗广告后阅读长文,并生成摘要用于评审会材料。
- 开发者:想接入浏览器自动化读网页文章,需要稳定的提取和重试机制。