Agent Skills
返回列表
OCR 文本校核

OCR 文本校核

办公效率 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_b818ef37/ocr-check。

技能介绍

要解决的具体问题

OCR 文本常出现条款跳号、页面底部截断、子条款遗漏、1 被识别为 l、公式不完整、版本内容混用等问题。人工逐页比对慢,且难以覆盖全部章节。本技能面向 PDF 转文本后的 OCR 结果,提供一套可执行的校核与修复流程,重点覆盖工程量清单、规范条款、附录、表格和公式这类结构化文档。

技能如何工作

  • 四阶段检查:先用正则提取 X.Y.Z 条款编号,检查连续性和缺失;再逐页比对 PDF 原图与 OCR 文本,确认截断、错位、跨引用和版本差异;随后运行脚本做全面兜底;最后对公式、金额、核心定义和修复区域抽样验证。
  • 六维校核:在编号连续性之外,补充内容完整性、页码映射、字符准确性、跨引用一致性和版本一致性检查,减少人工只查“明显缺失”的盲区。
  • 修复闭环:按 P0 到 P3 优先级处理条款缺失、内容截断、条款错位和 OCR 错字,读取 PDF 页面补全内容,再重跑检查脚本并抽样确认,避免修复引入新问题。

适用边界和注意点

它最适合有章节号、条款号、表格索引和附录引用的文档。对扫描件模糊、版式复杂、非条款型纯图像文档,仍需先保证 OCR 基础识别质量;公式、跨页表格、双页码体系和版本差异区域是高风险项,必须结合原图人工复核。

使用场景

  • 将 GB/T 50500-2024 清单 PDF 转文本后,逐章检查条款编号跳号与缺失。
  • 核对扫描件 PDF 与 OCR 文本,定位页面底部截断、子条款遗漏和公式不完整。
  • 对工程量清单附录和表格做页码映射、续表衔接与跨引用一致性检查。
  • 修复 OCR 错字、全半角标点、数字误识别,并重新运行脚本验证。

适合人员

  • 处理工程量清单 OCR 结果的造价/清单工程师,需要找出跳号、截断和缺失条款。
  • 维护规范文档数字版的文档工程师,需要确认 PDF 转文本后附录、表格和页码一致。
  • 负责 OCR 数据清洗的数据工程师,需要把错字、全半标点和公式问题分类修复。
  • 交付技术文档的编辑,需要在打包前完成条款连续性和关键公式人工复核。