屏幕 OCR 文字识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_25ab92ec/ocr-screen。
技能介绍
解决的问题
屏幕里的文字常常以截图、远程桌面、共享窗口或 PDF 渲染页面的形式出现:视觉上能读,但无法直接选择、搜索或继续编辑。ocr-screen 面向这种场景,把屏幕中的可见文本转成可复制的纯文本,尤其适合中文/英文混排、表格片段和需要批量处理的画面。
核心能力
- 中英文识别:支持中文和英文文字识别,适合双语界面、注释、字段名与正文混合的内容。
- 表格识别:对截图中的表格结构进行识别,输出更接近原表的信息组织,便于后续整理。
- 批量处理:可连续处理多块屏幕内容,而不是每次只截取单行、单列。
- 可导出结果:默认输出识别文字和可复制纯文本,并可选导出
Word/Excel,方便进入文档或表格流程。
使用注意
- 识别质量通常与屏幕清晰度、字体大小、对比度和表格线完整性有关。
- 技能主要处理屏幕可见文本;如果原始文件本身可编辑,优先使用原生文本会更准确。
- 首次使用前需要按资料完成依赖安装;实际可用依赖与运行环境会影响结果稳定性。
使用场景
- 远程支持时,把对方屏幕中的中英文提示文字转成可复制文本。
- 整理截图里的中英文表格,把识别结果导出到 Excel 便于核对。
- 把多个共享窗口中的界面字段批量识别为纯文本,用于核对需求。
- 将屏幕中的双语操作说明识别成纯文本,贴进工单或记录。
适合人员
- 远程技术支持:要把对方屏幕中的报错和界面文字快速转成可复制文本。
- 文档整理人员:要把截图中的中英文表格识别后导出 Excel。
- 测试工程师:要批量识别多个窗口中的界面字段并贴入缺陷记录。
- 外包交付人员:要把远程画面里的双语说明转成纯文本归档。