新闻转 Markdown
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_2c495456/news-to-markdown。
技能介绍
它解决什么问题
当 AI Agent 拿到今日头条、微信公众号、知乎、36kr 等文章 URL 时,直接抓取常遇到反爬、动态渲染、广告侧边栏和图片签名过期。News To Markdown 把这类页面转换成可编辑、可归档、可二次发布的 Markdown,减少后续清洗成本。
技能如何工作
核心流程是“抓取 -> 提取 -> 本地化”:
- 抓取回退:先尝试静态抓取,失败时切换到
Playwright,覆盖部分动态页面。 - 双引擎提取:使用 Mozilla Readability 与
news-extractor-node择优取正文,并针对 17 个平台内置选择器、域名和反爬适配。 - 图片处理:可通过
--download-images将远程图片下载到本地,避免微信、头条等图片 URL 数小时后失效。 - 发布兜底:未识别封面时生成占位封面写入
coverfrontmatter,降低下游发布链路失败概率。
适用边界与注意点
它适合文章 URL 转正文、批量提取搜索结果正文、去噪指定区域。若来源本身是 GitHub、Reddit、X、微博等结构化数据,通常无需再提取。对外发布前需保留来源与作者,并确认转载政策;使用 Skill 路径前建议审计第三方 npm 包源码,动态页面也可能需要额外浏览器环境。
使用场景
- 将今日头条、知乎或 36kr 文章 URL 转换为可编辑 Markdown,用于归档与摘要。
- 批量提取微信、虎嗅、华尔街见闻等搜索结果正文,整理成新闻简报材料。
- 处理动态渲染或反爬较严的文章页面,回退抓取并保留标题、正文与代码块。
- 发布微信公众号前,把远程图片下载到本地并补充占位封面,避免图片链接失效。
适合人员
- 需要把新闻文章转成 Markdown 做摘要的 AI Agent 工程师
- 每周要从微信、知乎、36kr 收集行业文章并归档的内容运营
- 处理反爬与动态页面抓取、需要稳定提取正文的自动化开发者
- 发布公众号前需要图片本地化与封面兜底的技术编辑