本地 OCR 文字识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_8353d908/ocr-rlocal。
技能介绍
解决什么问题
图片里的文字经常无法直接编辑、检索或录入表格。把扫描件、截图、表单图片转成文本是常见需求,但不想上传敏感图片到云端,也不愿申请 API Key。这个技能提供一个本地 OCR 入口:用 Tesseract.js 在本地识别图片中的中文和英文,输出纯文本或 JSON。
如何工作
- 本地运行:识别过程依赖本地 Tesseract.js,不要求 API Key。
- 语言选择:通过
--lang指定语言代码,默认chi_sim+eng;支持chi_sim、chi_tra、eng,可用+组合。 - 输出格式:默认输出纯文本;使用
--json可得到 JSON 结构,便于程序后续解析。 - 缓存机制:首次运行会下载约 20MB 的语言数据,之后本地缓存,减少重复下载。
适用边界
适合清晰、高对比度的印刷体图片,例如网页截图、电子文档扫描件、表格图片。对模糊图片、复杂背景、低分辨率或手写文字,识别准确率可能波动。若需要繁体中文,应显式选择 chi_tra;若只要英文,可设置 eng 以避免混排模型带来的额外开销。
使用场景
- 处理网页截图里的表格文本,使用默认 chi_sim+eng 输出纯文本便于复制。
- 将扫描件截图中的英文字段识别为 JSON,供脚本提取表单值。
- 识别繁体中文票据图片,用 --lang chi_tra 输出文字并核对金额字段。
- 在本地环境识别清晰英文文档截图,避免把敏感图片交给外部 OCR 服务。
适合人员
- 负责截图归档的测试工程师,需要把界面提示和表格转成文本。
- 整理票据的财务助理,需要识别中英票据里的字段并复制进表。
- 处理本地文档的自动化工程师,需要在无 API Key 时输出 JSON 供脚本读取。
- 整理截图资料的运维工程师,需要把英文告警文本从图片中提取出来。