公众号内容提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6eb4c6c0/wxpublic-fetch。
技能介绍
要解决的具体问题
微信公众号文章分散在时间线上,手动逐篇打开并复制内容效率低下。若想进行批量分析、存档或离线阅读,还需面对图片防盗链、格式转换和文件整理等一系列麻烦。
技能如何工作
这个技能提供了一套自动化的流程,将指定公众号在一定时间范围内的文章批量抓取并转换为本地 Markdown 文件。其工作流程清晰地分为五个步骤:
- 智能参数解析:你只需传入公众号名称和时间范围(默认最近一周)。技能会自动从参数或环境变量中读取必要的
AppID和SecureKey。若时间跨度超过60天,它会主动警告可能产生的费用并等待确认。 - 精准获取列表:技能通过调用后台脚本
wxpublic_list.py,获取目标公众号在指定日期范围内的所有文章URL及其发布日期,并进行严格的一一对应。 - 批量并行抓取:这是核心能力。技能会使用多线程(默认
5个并发)高效地将每篇文章的HTML内容转换为Markdown,同时使用另一组线程(默认8个并发)下载文章中的图片。所有图片被统一保存在共享的images/目录下以避免重复下载。 - 容错与重试:对于单篇文章的转换失败,系统会自动进行1次重试,最大限度保证成功率。无论是API余额不足还是转换错误,都会给出明确提示。
- 结果汇总与存档:所有成功转换的
.md文件路径、发布日期和原始URL会被整理并存入对话上下文,方便你后续直接对这些文章内容进行总结或提问。
适用边界与注意点
使用前请确认以下事项:
- 需要凭证:你必须拥有微信公众号平台的
AppID和SecureKey。可在 wxpub.aibana.art 注册获取,并通过参数--app-id、--secret或环境变量WXPUBLIC_APP_ID、WXPUBLIC_SECURE_KEY提供。 - 时间与成本:虽然可以查询较长时间范围,但超过60天的请求会触发二次确认,因为可能产生较多的API调用费用。
- 文件命名规则:生成的Markdown文件名会自动清理掉
/\:*?"|等非法字符,以确保在各类操作系统下能正常保存。 - 图片处理:针对
mmbiz.qpic.cn的图片防盗链,脚本会尝试跟随重定向(-L)下载;如果失败,则在Markdown中保留原始图片URL。
使用场景
- 市场分析团队需要抓取指定竞品公众号在最近一个季度内的所有文章,以分析其内容策略、发布频率和热点话题。
- 学术研究者为了完成一项社交媒体传播研究,需要批量下载某个权威公众号的全部历史文章,转换为纯文本用于文本挖掘和情感分析。
- 内容运营者计划将公众号的系列原创文章导出为结构化的 Markdown 文件,方便整理成电子文档或导入到知识库系统中。
- 数据工程师需要定期自动化地获取多个行业公众号的最新文章内容,作为数据源输入到公司的舆情监控平台或机器学习训练流程中。
适合人员
- 市场分析师:需要定期抓取竞品或行业公众号的内容数据,用于撰写市场分析报告和趋势预测。
- 学术研究者:需要大规模收集特定领域的公众号文章,作为社交媒体研究或计算社会科学分析的语料。
- 内容策划与运营人员:需要将公众号文章内容导出、转换格式,用于跨平台发布、内容整合或知识沉淀。
- 软件开发者:需要通过API或脚本自动获取公众号文章数据,集成到自定义的数据处理工具、应用或数据库中。