Agent Skills
返回列表
网页转 PDF 与 Markdown 转换器

网页转 PDF 与 Markdown 转换器

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a0cd3220/url2pdf-mk。

技能介绍

要解决的问题

抓取网页或微信文章时,常需要把正文、图片和版式保存到本地,便于离线阅读、归档或二次编辑。手动复制容易丢失样式,普通下载可能只有 HTML 或截图,批量处理则更麻烦。

工作方式和核心能力

url2pdf-mk 以 main.py 作为统一入口,根据输入自动路由:单条 URL 走单篇抓取,多条 URL 或 xlsx 文件走批量抓取。若本机有 Chrome/Chromium/Edge,可启动浏览器实例,通过 CDP 获取完整 DOM、计算样式并调用浏览器原生 PDF 打印,输出 PDF + Markdown;若没有浏览器,则降级为 HTTP 模式,输出 Markdown。

  • 单篇模式:scrape.py 抓取网页,保留图片、排版与样式。
  • 浏览器批量模式:batch_scrape.py 只启动一次浏览器实例,适合处理 xlsx 中的多个链接。
  • HTTP 批量模式:batch_http.py 不依赖浏览器,资源占用低,但无法处理 JavaScript 渲染内容,也不输出 PDF。

工具还会尝试识别微信文章标题和发布日期,并按日期在桌面创建归档目录,便于后续检索。

适用边界与注意点

它主要面向公开网页和微信文章的离线化,不替代复杂爬虫或数据清洗。视频/音频通常只保留封面或链接,微信小程序只能提取静态内容,HTTP 模式可能受反爬限制。默认模式可能复用真实 Chrome Profile 并访问 Cookie/登录态,因此公开内容建议优先使用 --isolated;需要登录态时再考虑默认模式或沙箱环境。

使用场景

  • 把公众号长文保存为离线 PDF 和 Markdown,保留图片与排版。
  • 从 xlsx 中读取多条文章链接,批量生成离线文档。
  • 在无法使用浏览器的环境中抓取静态网页,仅输出 Markdown。
  • 抓取微信文章时识别标题和发布日期,并按日期归档到桌面。

适合人员

  • 需要离线保存微信文章或网页资料的内容编辑。
  • 要批量归档公众号链接并保留版式的运营。
  • 需要在无浏览器环境抓取静态网页 Markdown 的工程师。
  • 要把网页转成可检索 Markdown 和 PDF 的技术文档负责人。