Agent Skills
返回列表
📊

微信公众号文章抓取

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_2015f712/wechat-article-fetcher-cn。

技能介绍

要解决的问题

微信公众号文章常以移动端页面下发,正文可能被 #js_content { visibility: hidden } 隐藏;批量抓取时还可能遇到 IMA 的 220021 配额限制或 220030 文件级拒绝。这个技能面向需要离线阅读、备份/归档文章原始布局的场景,而不是把内容转成 Markdown。

工作方式和能力

  • 支持单个 URL 或 IMA 知识库批量模式,批量筛选优先使用 media_id.startswith('wechatarticle_')。
  • 抓取时通过移动端 MicroMessenger UA 获取完整 HTML,避免拿到约 10 KB 的精简版。
  • 输出为独立 HTML 文件,保留 div、段落、引用、图片和代码块。
  • 注入 4 类幂等修复:可见性覆盖、桌面布局适配、封面移除、无关元素剔除。
  • 剔除分为 safe、normal、strict 三档,用于控制工具栏、二维码、广告、评论和 H5 组件的清理力度。

边界与注意点

适合已具备 URL 或 IMA 中 wechatarticle_ 资源的文章。若文章不在 IMA 且没有 URL,需先解决发现来源;纯 PDF、扫描件或图片正文应改用 OCR 类技能。批量运行前应先测试配额,不要盲目重试 220021,也不要尝试激进绕过 IMA 限制。

使用场景

  • 拿到微信文章 URL 后,需要把正文、图片和代码块保存为可离线打开的 HTML 文件。
  • 从 IMA 知识库导出中筛出 media_id 以 wechatarticle_ 开头的项,批量备份公众号文章。
  • 清理文章里的底部工具栏、二维码、广告和评论,但保留标题、正文、图片和原始布局。
  • 排查抓取到的页面没有正文或图片,检查是否使用了移动端 UA 和 CSS 修复注入。

适合人员

  • 要把微信文章按原布局归档的知识管理工程师。
  • 维护 IMA 知识库并批量导出公众号材料的资料运营。
  • 需要修复抓取 HTML 反爬样式的前端工程师。
  • 做离线阅读与合规留存的文档工程师。