超强 AI OCR-Pro v2.1 中英文与数学公式识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6455574a/super-ocr-pro。
技能介绍
解决的问题
扫描件、手写作业、公式截图和论文 PDF 里,纯文本提取常会出现断字、误识别、公式丢失。对工程任务来说,问题不只是“能识字”,而是能否在中文、英文、手写体和数学公式之间稳定输出可用结果,并且能保留位置和结构。
技能如何工作
该技能把 OCR 拆成三层:
- 图像预处理:提供
standard、english、handwriting三种模式,分别处理去噪、对比度、锐化和断笔修复。 - 多引擎识别:根据输入选择
RapidOCR、EasyOCR、TrOCR、Pix2Text、PP-OCR 系列等引擎,手写英文可走TrOCR,公式图片可转LaTeX。 - LLM 纠错:用视觉模型对照原图修正 OCR 文本,重点处理
rn/m、cl/d、0/O等易混淆字符。
数字 PDF 会优先提取嵌入文字;扫描 PDF 转成图片后再识别;结果可输出为纯文本、JSON、Markdown 或 LaTeX。
适用边界
它适合中文扫描版、英文教材、手写作业、公式截图和含公式论文,但需要 Python 环境和网络下载模型。TrOCR 模型较大,LLM 纠错会产生 API 调用。对表格、低质量扫描件或混合版式,需要结合多引擎和预处理策略,不能只依赖单一识别结果。
使用场景
- 处理英文手写作业截图,提取可编辑文本并降低 rn/m、cl/d 误识。
- 把数学公式图片转成 LaTeX,用于论文公式整理和题库录入。
- 识别扫描版中文 PDF,输出带位置的 JSON,便于后续归档和检索。
- 对含公式论文扫描件做文字与公式分离,生成 Markdown 草稿。
适合人员
- 整理英文手写作业或课程笔记的学生,需要把图片变成可编辑文本。
- 录入数学公式题库或论文公式的科研人员,需要稳定输出 LaTeX。
- 处理扫描版合同、教材或报告的产品、运营、编辑,需要结构化文本和位置信息。
- 做文档数字化和 OCR 流水线集成的工程师,需要多引擎与 JSON 输出。