本地 PDF OCR 转 Markdown 工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_543d2acf/pdf-ocr-zc。
技能介绍
解决的痛点
扫描件 PDF 常只有图片层,无法复制、搜索、进入检索或向量化流程。若每次手工打开 OCR 工具、等待处理、再整理文本,批量文档处理就会变成重复劳动。这个技能面向的就是本地批量扫描件:先把 PDF 变成可搜索文件,再为后续提取 Markdown 做准备。
工作方式
技能在本机调用 ocrmypdf 和已安装的 Tesseract,不依赖外部服务。输入通常是单个 PDF 或整个目录,处理后会生成带文字层的 PDF,便于后续复制、检索或继续转换。批量模式下可遍历目录中的 *.pdf 文件,逐个处理并输出对应结果。若需要中文简体识别,可通过 --lang chi_sim 指定语言模型,避免自动检测带来的误判。脚本会将错误写入 logs/pdf_ocr_error.log,方便排查坏文件、依赖缺失或参数问题。资料里也提到可结合 pdf2txt.py 做进一步文本化,但核心仍是 OCR 层生成。
适用边界
它适合扫描件、本地处理、离线/内网环境,以及需要先生成可搜索 PDF 的工作流。对排版复杂、手写体、低分辨率图片,识别质量仍受图像和模型限制。技能本身不会替代 PDF 结构解析,也不负责排版还原、表格还原或跨文档合并;若需要更细粒度的 Markdown,还需要后续转换步骤。使用前应确保本机已有 Tesseract 与 ocrmypdf,并且目录中的 PDF 可写或输出路径可访问。
使用场景
- 批量整理扫描版合同 PDF,为后续检索和向量化生成可搜索文字层
- 处理一整目录的历史报告,避免逐份打开 OCR 工具手工等待
- 在本地 Agent 工作流中接入 PDF 预处理步骤,供后续文本提取使用
- 为中文简体扫描件指定 OCR 语言模型,减少自动检测造成的识别偏差
适合人员
- 维护本地文档流水线的工程师,需要把扫描 PDF 稳定转成可搜索文件
- 搭建 Agent 自动化流程的开发者,需要把 OCR 作为前置步骤接入
- 处理扫描报告的团队负责人,需要批量生成可检索版本
- 关注本地与离线处理的技术人员,不希望 PDF 上传到外部服务