Agent Skills
返回列表
📁

密集 PDF 转 LLM 文本与页面对齐 Markdown

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_3c6cb52e/convert-dense-pdfs-into-llm-ready-text-and-page-aligned-markdown-with-olmocr。

技能介绍

问题

扫描件、表格密集或排版复杂的 PDF 往往不能直接给 LLM 使用。直接抽取文本容易出现乱序、缺页码、块边界不清,导致后续 chunking、搜索、实体提取或引用定位不稳定。这个技能把文档转换任务前置成一条可复用的处理步骤,而不是让代理临时拼一套解析脚本。

工作方式

技能围绕 olmOCR 展开,面向“扫描版 / 版式复杂文档 -> LLM 可消费文本 / Markdown”的链路。核心能力包括:

  • 将密集 PDF 转换为干净的文本,适合分块、检索和提示词输入。
  • 生成页面对齐的 Markdown,便于保留页面边界、段落顺序和引用定位。
  • 支持后续工作流:chunking、search、extraction、citation,而不是只做一次 OCR 输出。

它依赖 PDF 渲染与视觉语言模型能力。资料提到需要 poppler-utils 以及用于渲染 PDF 图像的额外字体;本地推理可选 NVIDIA GPU,上游模型基于 7B 参数视觉语言模型,因此 GPU 是更现实的运行条件。处理路径可理解为:PDF 页面渲染为图像 -> olmOCR 进行版面理解与文本生成 -> 输出 LLM-ready text 或 page-aligned Markdown。

边界与注意点

更适合扫描版、版式复杂、需要保留页面结构的文档转换;如果目标只是复制纯文本,轻量 PDF 文本抽取可能已经够用。使用这个技能时要关注输出是否满足下游要求:块是否过碎、页面对齐是否稳定、表格/公式是否被错误拼接。由于依赖模型推理和字体渲染,运行环境比纯文本转换更重,需要预留调试版面解析异常的空间。

使用场景

  • 把扫描版合同按页转成 Markdown,便于 RAG 检索和条款引用。
  • 将表格密集的报表 PDF 清洗成文本,供下游分块和实体抽取。
  • 处理版式复杂的说明书,生成带页面边界的 Markdown 用于问答定位。
  • 把旧文档扫描件批量变成 LLM 可读文本,替代临时 OCR 脚本。

适合人员

  • 做 RAG 应用的工程师,需要把扫描 PDF 转成稳定分块文本。
  • 知识工程人员,需要从复杂版式 PDF 提取可引用文本。
  • 自动化流程工程师,需要把密集文档接入 LLM 处理链路。
  • 文档处理维护者,需要替代临时 OCR 脚本并保持页面对齐。