截图 OCR 文字识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_328225df/screenshot-ocr-pro。
技能介绍
要解决的问题
在整理会议截图、合同图片、报表截图或群聊图片时,核心痛点不是“能不能读出字”,而是能否拿到可直接继续编辑的结构化文本:中文、英文、数字、代码、表格和换行是否还能保持原样。传统复制粘贴无法作用于图片,人工转录又容易把表格拆散、把段落合并、把中英混排顺序搞错。这个技能把这类请求收敛为明确的图片 OCR 工作流。
工作方式与核心能力
技能围绕图片路径输入展开,适合单张快速识别和批量处理:
- 图片读取:支持
.png、.jpg、.jpeg、.bmp、.webp等常见格式。 - 文字提取:识别中英文混合内容,并尽量保留原文段落结构和换行位置。
- 批量处理:传入多张图片时按顺序处理,结果用分隔线隔开,并标注来源文件名。
- 表格还原:遇到表格时判断输出格式;简单表格输出 Markdown 表格,复杂或数据量较大的表格输出 CSV。
关键步骤是:用户提供图片路径 -> 使用 Read 工具读取图片 -> 按内容类型提取文字或表格 -> 按单图/批量规则格式化返回。
适用边界
它适合截图、扫描件、截图表格等“已有图像中的可见文字”提取,不适合图片不可见内容的推测。图片模糊、分辨率低、遮挡严重或手写体识别困难时,结果可能不可用,需要提供更清晰的原图。对于高度复杂排版、跨页表格或大量密集数据,建议结合人工校验后再进入下游文档处理。
使用场景
- 整理群聊截图中的会议要点,提取文字并保留段落换行,方便贴进纪要文档。
- 把多张合同条款截图按顺序识别成文本,标注来源文件名,再逐条核对条款。
- 将数据报表截图里的简单表格还原为 Markdown 表格,复杂表格导出为 CSV。
- 从产品配置说明图片中提取中英混合文字,保持段落结构,用于本地文档校对。
适合人员
- 需要把截图里的会议纪要转成可编辑文字的行政助理
- 每周整理多张合同截图并核对条款的法务专员
- 要把数据报表截图中的表格转为 Markdown 或 CSV 的数据分析助理
- 校对产品配置文档中英混排文本的本地化编辑