微信文章处理流水线
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_ba7c4de9/wechat-article-pipeline。
技能介绍
要解决的问题
微信文章正文常以图文混排形式存在,直接复制文本会丢失标题、列表、表格、代码块和图片位置。若要把一篇 mp.weixin.qq.com 文章沉淀为可离线阅读、可打印的文档,通常需要手动打开网页、识别正文边界、下载图片、调整排版,再渲染 PDF。这个流程对工程师来说步骤固定但重复性高。
工作流与核心能力
该技能把上述流程拆成可执行的工作流:
- 入库与确认:收到文章链接后,先将 URL 写入
IMA知识库,再读取媒体信息,确认文章入口。 - 抓取与下载:用
WebFetch提取完整正文、图片 URL、列表、表格和代码块等结构;图片下载到本地工作目录。 - 清洗与排版:去掉作者信息、公众号来源、广告、预览标签和关注引导,再生成中文排版 HTML。
- PDF 输出:通过
Playwright/Chromium渲染为 A4 PDF,并交付文件。
适用边界与注意点
该技能面向微信公众号文章链接,依赖 IMA、相关 skill 和浏览器渲染环境。图片下载可能遇到防盗链,需要带 https://mp.weixin.qq.com/ Referer 重试;彩色 emoji 可能无法按原样式渲染;Chromium 生成的 PDF 中文视觉通常正常,但文本提取可能受 CID 编码影响。
使用场景
- 拿到微信技术文章链接后,抓取正文和图片并生成可离线打印的 PDF。
- 整理公众号里的资料时,将指定文章导入 IMA 知识库,并输出一份清洗后的排版文档。
- 把一篇微信图文长文转成 A4 PDF,保留段落、列表、图片和表格等阅读结构。
- 排查资料时,将微信文章正文与图片集中下载到本地,并去除广告和关注引导。
适合人员
- 需要沉淀微信技术资料的工程师,希望把公众号文章转成可离线查阅的 PDF。
- 维护知识库存量的产品经理,希望将指定微信文章导入 IMA 并留存排版副本。
- 写文档的运营,想把微信图文长文转成 A4 PDF,保留图片、列表和表格结构。
- 做资料清理的编辑,需要去除广告和关注引导,只保留正文与配图。