PDF 文字提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-rn88lg3j/ocr-pdf。
技能介绍
解决的问题
从 PDF 中取文字看起来简单,但真实文档经常同时包含文字层和扫描图像。文字版页面可以直接读取,扫描页却只保存为图片;如果手动处理,需要逐页判断哪些内容缺失,再把扫描页导出为图片、调用 OCR、将识别结果插回原文。这个过程容易漏页、重复处理或打乱原有顺序。
工作方式
- 接收用户上传的 PDF,确认本地文件路径后执行
scripts/pdf_text_extractor.py。 - 脚本先提取所有页面可读取的文本,并自动检测扫描页面;对于扫描页,会渲染成图片以便后续识别。
- 如果返回结果包含
scanned_pages,逐页读取图片并转为 base64,再调用scripts.ocr_tools.ocr_for_data_base64做 OCR 识别。 - 将 OCR 结果替换原文占位符,合并成完整文本;按需求直接输出文字,或生成带文件来源、提取状态和正文结构的 Markdown 文件。
适用边界
- 建议处理小于 50MB 的 PDF,过大的文件可能造成响应缓慢。
- 不支持加密或受密码保护的 PDF。
- 表格、多栏、复杂版式可能无法完全保留层级。
- OCR 准确性受图片清晰度、字体、背景干扰影响;若缺少 API 密钥,不能自行搜索或编造识别内容。
使用场景
- 收到含扫描页的合同 PDF,需要提取全部文字并生成可审阅的 Markdown 稿。
- 整理扫描版说明书,要求把图像页转成文本,合并回原阅读顺序。
- 处理客户发来的 PDF 报告,需要直接读取文字层并保留标题层级。
- 导出 PDF 摘要到 Markdown,供后续检索和归档,不依赖原始版式。
适合人员
- 需要把扫描版合同变成可编辑文字的合同审查人员
- 整理设备说明书时要求提取扫描页文字的技术支持工程师
- 把 PDF 报告转成 Markdown 做归档的文档管理员
- 处理客户发来的混合版式 PDF 并整理摘要的项目助理