智能图片转文字
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_8a153b62/smart-ocr。
技能介绍
解决的问题
当 .doc、.docx、.pdf 文件主要是扫描页时,普通 OCR 常出现形近字、中英文混排空格、乱码片段和页码噪声。这个技能针对图片文字识别设计了一条可落地的清洗链路,而不是只做一次基础 OCR。
工作流程与边界
它先将文档转为图片,再通过 ocr_pipeline.py 执行 Tesseract 多策略识别、ocr_errors.json 常见错误替换和中文间空格清理。随后 ocr_deepseek.py 调用 DeepSeek 对文本做 0-10 分质量评分与受约束纠错;未配置 DEEPSEEK_API_KEY 时,会回退为仅 Tesseract 识别结果。技能还会跳过明显马赛克、模糊、过小或无文字图片,并生成带 ▎图片 N 标签的 .docx 输出。它适合扫描中英文档、图片文字提取和对 OCR 结果做二次校对;不适合作为高精度表格还原、复杂版式解析或完全离线且无需 AI 纠错的纯 OCR 场景。
使用场景
- 处理扫描件 PDF,把每页图片中的中英文正文转成可编辑文本并导出 .docx。
- 用户上传包含多张图片的 .docx,要求识别图中合同条款并修正形近字。
- 对 Tesseract 结果乱码较多的扫描页,先评分再调用 DeepSeek 做保守纠错。
- 识别前过滤马赛克、小图标和无法读取图片,并在文档中标注跳过原因。
适合人员
- 处理扫描合同或报告的文档专员,需要把图片正文转为可编辑文本并减少错字。
- 维护知识库的技术写作工程师,需要抽取多页扫描资料中的中英文段落。
- 做 OCR 质量对比的平台工程师,需要一条可回退到 Tesseract 的校验流水线。
- 处理档案图片的档案管理员,需要跳过马赛克和无效图片并保留来源文件名。