扫描 PDF 转电子书
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_c11cceac/scannedpdf2ebook 到你的 AI 助手中。
技能介绍
问题:扫描 PDF 难以变成可编辑电子书
很多旧书、论文、讲义以扫描版 PDF 保存,文字在图片里,复制、检索、排版和阅读体验都受限。直接把 PDF 塞进阅读器也不够,想要转成 Markdown 或 EPUB,常遇到标题层级丢失、公式变乱码、表格断行、图片散落等问题。本技能面向这类“扫描件到结构化电子书”的转换任务,适合在本地环境处理中文、英文书籍和技术文档。
工作方式:本地 OCR + 多后端转换
它把 PDF 当作渲染文档,而不是简单文本提取。转换时会先判断 PDF 是否已有可用文本层,若每页字符足够,就直接提取,避免无意义 OCR;若属于扫描版,则调用本地 OCR 后端进行识别。支持 pdf-craft、Marker、MinerU 等后端,可按中文质量、公式、表格、速度或显存占用做选择。
核心输出包括:
- Markdown:保留标题层级,提取图片到资源目录,适合二次编辑与版本管理。
- EPUB:生成目录结构,表格渲染为 HTML,公式渲染为 MathML,适合直接导入电子书阅读。
- 批量处理:按目录转换,已存在输出自动跳过,中断后可重跑。
运行时依赖本地 Python 环境、PDF 渲染工具和 OCR 模型。GPU 存在时可启用更大模型,CPU 环境会自动降级到更轻量的配置,Apple Silicon 也可通过 MPS 利用 GPU。
适用边界
该技能主要优化中文和英文场景,对日文、韩文也有一定支持,但其他语言需要自行验证。EPUB 输出目前仅 pdf-craft 后端支持;若追求公式、表格、代码块质量,可优先尝试 MinerU;若追求批量速度,可选择 Marker。扫描件质量较差、页面倾斜、水印严重或手写内容时,识别效果会下降。转换结果仍需人工校对,尤其是脚注、页眉页脚、复杂跨页表格和出版级排版。
使用场景
- 把扫描版中文教材 PDF 转成 EPUB,并保留目录、图片和公式。
- 将一批论文扫描页批量转 Markdown,按目录输出并跳过已有文件。
- 在本地环境转换技术书,选择 MinerU 后端处理复杂公式和表格。
- 先检测 PDF 文本层,再决定是否 OCR,减少无必要识别。
适合人员
- 整理旧版中文论文扫描页为可检索 Markdown 的研究助理。
- 把扫描教材转为 EPUB 并导入电子阅读器的教师。
- 在无 API 环境下批量转换技术文档的文档工程师。
- 维护中文讲义或古籍数字化档案的内容编辑。