Agent Skills
返回列表
PDF 扫描转 Markdown

PDF 扫描转 Markdown

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_3afb9517/pdf-scan-to-md。

技能介绍

问题场景

不少工程文档、论文和扫描件不是纯文本 PDF,直接复制会丢失表格结构、数学公式和多栏排版;若文档是图片化内容,普通解析几乎不可用。pdf文档转markdown 针对这类 PDF,把文本、公式、表格转成可编辑的 Markdown。

工作方式

技能的核心是多引擎转换与回退:

  • 主引擎 MinerU,支持扫描件/图片 PDF、数学公式转 LaTeX、表格重建,并可选择本地模型或云端 API;
  • 备用引擎 PaddleOCR,适合中英文纯文字识别,也可本地或在线使用;
  • 无 Token 时可兼容系统自带 OCR、tesseract 或之前配置,作为离线 fallback。

关键步骤通常是:准备 PDF、按需申请 MinerU 或 PaddleOCR Token、运行转换脚本,脚本自动选择引擎并在超额或失败时切换。

适用边界

该技能更适合需要保留结构的文档转换,而不是单纯复制正文。云端 API 通常效果更好,本地模式首次需下载模型且速度较慢;MinerU 本地模型约 2GB,PaddleOCR 本地约 300MB。超过单文件上限时会分片处理,具体额度以对应引擎服务为准。

使用场景

  • 处理扫描版论文 PDF 时,把正文、公式和表格批量转为可编辑 Markdown。
  • 整理 100 页以内合同 PDF,提取条款文本并重建表格,方便后续比对。
  • 将多语言扫描件转成 Markdown,用本地 OCR 或 PaddleOCR 做离线识别。
  • 调试公式密集型报告转换,把数学公式转成 LaTeX 并检查文档结构。

适合人员

  • 维护内部知识库的工程师,需要把扫描文档沉淀为可检索 Markdown。
  • 做文献整理的研究者,需要提取公式、表格并保留原始结构。
  • 处理批量合同的法务运营,需要 OCR 文本提取和表格重建。
  • 本地部署 AI 工具链的开发者,需要离线 OCR 和引擎回退方案。