Agent Skills
返回列表
📁

PDF 文字提取

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @org-rn88lg3j/ocr-pdf。

技能介绍

解决的问题

从 PDF 中取文字看起来简单,但真实文档经常同时包含文字层和扫描图像。文字版页面可以直接读取,扫描页却只保存为图片;如果手动处理,需要逐页判断哪些内容缺失,再把扫描页导出为图片、调用 OCR、将识别结果插回原文。这个过程容易漏页、重复处理或打乱原有顺序。

工作方式

  • 接收用户上传的 PDF,确认本地文件路径后执行 scripts/pdf_text_extractor.py。
  • 脚本先提取所有页面可读取的文本,并自动检测扫描页面;对于扫描页,会渲染成图片以便后续识别。
  • 如果返回结果包含 scanned_pages,逐页读取图片并转为 base64,再调用 scripts.ocr_tools.ocr_for_data_base64 做 OCR 识别。
  • 将 OCR 结果替换原文占位符,合并成完整文本;按需求直接输出文字,或生成带文件来源、提取状态和正文结构的 Markdown 文件。

适用边界

  • 建议处理小于 50MB 的 PDF,过大的文件可能造成响应缓慢。
  • 不支持加密或受密码保护的 PDF。
  • 表格、多栏、复杂版式可能无法完全保留层级。
  • OCR 准确性受图片清晰度、字体、背景干扰影响;若缺少 API 密钥,不能自行搜索或编造识别内容。

使用场景

  • 收到含扫描页的合同 PDF,需要提取全部文字并生成可审阅的 Markdown 稿。
  • 整理扫描版说明书,要求把图像页转成文本,合并回原阅读顺序。
  • 处理客户发来的 PDF 报告,需要直接读取文字层并保留标题层级。
  • 导出 PDF 摘要到 Markdown,供后续检索和归档,不依赖原始版式。

适合人员

  • 需要把扫描版合同变成可编辑文字的合同审查人员
  • 整理设备说明书时要求提取扫描页文字的技术支持工程师
  • 把 PDF 报告转成 Markdown 做归档的文档管理员
  • 处理客户发来的混合版式 PDF 并整理摘要的项目助理