PDF 扫描转 Markdown
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_3afb9517/pdf-scan-to-md。
技能介绍
问题场景
不少工程文档、论文和扫描件不是纯文本 PDF,直接复制会丢失表格结构、数学公式和多栏排版;若文档是图片化内容,普通解析几乎不可用。pdf文档转markdown 针对这类 PDF,把文本、公式、表格转成可编辑的 Markdown。
工作方式
技能的核心是多引擎转换与回退:
- 主引擎
MinerU,支持扫描件/图片 PDF、数学公式转LaTeX、表格重建,并可选择本地模型或云端 API; - 备用引擎
PaddleOCR,适合中英文纯文字识别,也可本地或在线使用; - 无 Token 时可兼容系统自带 OCR、
tesseract或之前配置,作为离线 fallback。
关键步骤通常是:准备 PDF、按需申请 MinerU 或 PaddleOCR Token、运行转换脚本,脚本自动选择引擎并在超额或失败时切换。
适用边界
该技能更适合需要保留结构的文档转换,而不是单纯复制正文。云端 API 通常效果更好,本地模式首次需下载模型且速度较慢;MinerU 本地模型约 2GB,PaddleOCR 本地约 300MB。超过单文件上限时会分片处理,具体额度以对应引擎服务为准。
使用场景
- 处理扫描版论文 PDF 时,把正文、公式和表格批量转为可编辑 Markdown。
- 整理 100 页以内合同 PDF,提取条款文本并重建表格,方便后续比对。
- 将多语言扫描件转成 Markdown,用本地 OCR 或 PaddleOCR 做离线识别。
- 调试公式密集型报告转换,把数学公式转成 LaTeX 并检查文档结构。
适合人员
- 维护内部知识库的工程师,需要把扫描文档沉淀为可检索 Markdown。
- 做文献整理的研究者,需要提取公式、表格并保留原始结构。
- 处理批量合同的法务运营,需要 OCR 文本提取和表格重建。
- 本地部署 AI 工具链的开发者,需要离线 OCR 和引擎回退方案。