OCR-Pro 中英文识别加强版
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6455574a/ocr-pro-v2。
技能介绍
问题
扫描件、PDF 和手写文档经常让文字提取变得不稳定:印刷体中英文混排、低质量扫描、手写断笔、数学公式混在正文中,单模型识别容易出现 rn/m、0/O 混淆,也会丢失标题、段落和公式结构。
工作方式
该技能按 预处理 → 多引擎识别 → LLM 纠错 组织流程。输入 PDF 时先判断数字 PDF 或扫描件,能直接提取文字就不走 OCR;扫描件转图片后,再按英文印刷体、手写体、中英混合等场景选择预处理策略。识别层可组合 RapidOCR、EasyOCR、TrOCR、Pix2Text、PP-OCR 等引擎:普通中英文走本地轻量模型,手写英文优先 TrOCR,公式图片用 Pix2Text 输出 LaTeX,含公式文档则拆分文字与公式区域。最后用视觉模型对照原图校正 OCR 文本,输出 txt、json、markdown 或 latex。
适用与边界
适合英文手写作业、数学公式、中英文扫描件、教材论文和表格结构提取。注意 TrOCR 模型较大,首次使用依赖网络下载;公式识别面向明确公式图像,复杂排版仍需人工校对;高准确率场景建议多引擎交叉验证并保留原图用于 LLM 纠错。
使用场景
- 处理数学公式扫描件时,把公式区域识别为 LaTeX,并与正文文字分离。
- 审阅英文手写作业图片,将断笔、模糊字迹转成可编辑文本并校正易混字符。
- 将中文扫描版 PDF 转为结构化 Markdown,保留标题和段落用于归档。
- 对低质量中英混排扫描件做多引擎交叉识别,输出带位置置信度的 JSON。
适合人员
- 负责归档中文扫描教材或合同文档的档案管理员,需要转成可检索 Markdown。
- 批改或整理英文手写作业的教研人员,需要把模糊字迹转成文本。
- 处理论文扫描版的科研人员,需要把公式提取成 LaTeX 并保留正文。
- 维护 OCR 数据管线的工程师,需要带位置和置信度的 JSON 输出。