Agent Skills
返回列表
屏幕 OCR 文字识别

屏幕 OCR 文字识别

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_25ab92ec/ocr-screen。

技能介绍

解决的问题

屏幕里的文字常常以截图、远程桌面、共享窗口或 PDF 渲染页面的形式出现:视觉上能读,但无法直接选择、搜索或继续编辑。ocr-screen 面向这种场景,把屏幕中的可见文本转成可复制的纯文本,尤其适合中文/英文混排、表格片段和需要批量处理的画面。

核心能力

  • 中英文识别:支持中文和英文文字识别,适合双语界面、注释、字段名与正文混合的内容。
  • 表格识别:对截图中的表格结构进行识别,输出更接近原表的信息组织,便于后续整理。
  • 批量处理:可连续处理多块屏幕内容,而不是每次只截取单行、单列。
  • 可导出结果:默认输出识别文字和可复制纯文本,并可选导出 Word / Excel,方便进入文档或表格流程。

使用注意

  • 识别质量通常与屏幕清晰度、字体大小、对比度和表格线完整性有关。
  • 技能主要处理屏幕可见文本;如果原始文件本身可编辑,优先使用原生文本会更准确。
  • 首次使用前需要按资料完成依赖安装;实际可用依赖与运行环境会影响结果稳定性。

使用场景

  • 远程支持时,把对方屏幕中的中英文提示文字转成可复制文本。
  • 整理截图里的中英文表格,把识别结果导出到 Excel 便于核对。
  • 把多个共享窗口中的界面字段批量识别为纯文本,用于核对需求。
  • 将屏幕中的双语操作说明识别成纯文本,贴进工单或记录。

适合人员

  • 远程技术支持:要把对方屏幕中的报错和界面文字快速转成可复制文本。
  • 文档整理人员:要把截图中的中英文表格识别后导出 Excel。
  • 测试工程师:要批量识别多个窗口中的界面字段并贴入缺陷记录。
  • 外包交付人员:要把远程画面里的双语说明转成纯文本归档。