Agent Skills
返回列表
本地 OCR 文字识别

本地 OCR 文字识别

办公效率 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_8353d908/ocr-rlocal。

技能介绍

解决什么问题

图片里的文字经常无法直接编辑、检索或录入表格。把扫描件、截图、表单图片转成文本是常见需求,但不想上传敏感图片到云端,也不愿申请 API Key。这个技能提供一个本地 OCR 入口:用 Tesseract.js 在本地识别图片中的中文和英文,输出纯文本或 JSON。

如何工作

  • 本地运行:识别过程依赖本地 Tesseract.js,不要求 API Key。
  • 语言选择:通过 --lang 指定语言代码,默认 chi_sim+eng;支持 chi_sim、chi_tra、eng,可用 + 组合。
  • 输出格式:默认输出纯文本;使用 --json 可得到 JSON 结构,便于程序后续解析。
  • 缓存机制:首次运行会下载约 20MB 的语言数据,之后本地缓存,减少重复下载。

适用边界

适合清晰、高对比度的印刷体图片,例如网页截图、电子文档扫描件、表格图片。对模糊图片、复杂背景、低分辨率或手写文字,识别准确率可能波动。若需要繁体中文,应显式选择 chi_tra;若只要英文,可设置 eng 以避免混排模型带来的额外开销。

使用场景

  • 处理网页截图里的表格文本,使用默认 chi_sim+eng 输出纯文本便于复制。
  • 将扫描件截图中的英文字段识别为 JSON,供脚本提取表单值。
  • 识别繁体中文票据图片,用 --lang chi_tra 输出文字并核对金额字段。
  • 在本地环境识别清晰英文文档截图,避免把敏感图片交给外部 OCR 服务。

适合人员

  • 负责截图归档的测试工程师,需要把界面提示和表格转成文本。
  • 整理票据的财务助理,需要识别中英票据里的字段并复制进表。
  • 处理本地文档的自动化工程师,需要在无 API Key 时输出 JSON 供脚本读取。
  • 整理截图资料的运维工程师,需要把英文告警文本从图片中提取出来。