OCR 文本校核
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_b818ef37/ocr-check。
技能介绍
要解决的具体问题
OCR 文本常出现条款跳号、页面底部截断、子条款遗漏、1 被识别为 l、公式不完整、版本内容混用等问题。人工逐页比对慢,且难以覆盖全部章节。本技能面向 PDF 转文本后的 OCR 结果,提供一套可执行的校核与修复流程,重点覆盖工程量清单、规范条款、附录、表格和公式这类结构化文档。
技能如何工作
- 四阶段检查:先用正则提取
X.Y.Z条款编号,检查连续性和缺失;再逐页比对 PDF 原图与 OCR 文本,确认截断、错位、跨引用和版本差异;随后运行脚本做全面兜底;最后对公式、金额、核心定义和修复区域抽样验证。 - 六维校核:在编号连续性之外,补充内容完整性、页码映射、字符准确性、跨引用一致性和版本一致性检查,减少人工只查“明显缺失”的盲区。
- 修复闭环:按
P0到P3优先级处理条款缺失、内容截断、条款错位和 OCR 错字,读取 PDF 页面补全内容,再重跑检查脚本并抽样确认,避免修复引入新问题。
适用边界和注意点
它最适合有章节号、条款号、表格索引和附录引用的文档。对扫描件模糊、版式复杂、非条款型纯图像文档,仍需先保证 OCR 基础识别质量;公式、跨页表格、双页码体系和版本差异区域是高风险项,必须结合原图人工复核。
使用场景
- 将 GB/T 50500-2024 清单 PDF 转文本后,逐章检查条款编号跳号与缺失。
- 核对扫描件 PDF 与 OCR 文本,定位页面底部截断、子条款遗漏和公式不完整。
- 对工程量清单附录和表格做页码映射、续表衔接与跨引用一致性检查。
- 修复 OCR 错字、全半角标点、数字误识别,并重新运行脚本验证。
适合人员
- 处理工程量清单 OCR 结果的造价/清单工程师,需要找出跳号、截断和缺失条款。
- 维护规范文档数字版的文档工程师,需要确认 PDF 转文本后附录、表格和页码一致。
- 负责 OCR 数据清洗的数据工程师,需要把错字、全半标点和公式问题分类修复。
- 交付技术文档的编辑,需要在打包前完成条款连续性和关键公式人工复核。