PaddleOCR 文本识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-paddleocr-text-recognition 到 AI 助手中。
技能介绍
适合解决什么问题
当需要把截图、照片、扫描件、PDF 页面或图像 URL 中的文字提取为 line/box 级别文本时,这个技能用于调用 PaddleOCR API 做基础 OCR。它不是文档解析:遇到表格、公式、图表、复杂版式时,不应把它作为首选。
技能如何工作
技能围绕一个明确边界展开:输入是图像或 PDF,目标是得到可读文本,而不是结构化文档。常见用法包括:
- 从 URL 获取图像/PDF 并识别文字
- 从 本地文件 读取图像/PDF 并识别文字
- 在 CLI 层通过
paddleocr api --help查看输出格式与参数
默认情况下,API 会启用文档预处理,包括 unwarping 和 orientation classification,因此对拍摄弯曲、折叠、透视明显或方向不确定的文档更稳。对于截图、扫描端正、方向明确的图片,可以关闭预处理以获得更快结果。
适用边界与注意点
- 不要用 于复杂表格、公式、图表或多版式文档解析
- 结果应完整展示给用户,除非内容超过
10000字符,不要随意用省略号截断 - 错误要具体反馈:
PADDLEOCR_ACCESS_TOKEN缺失/无效、API 配额受限、图片无文本等 - 多页文档可摘要,但用户明确要求完整结果时应提供完整内容
使用场景
- 收到含产品参数、错误提示的截图,需要快速提取可见文字用于工单排查。
- 把扫描合同单页照片中的条款文字转出,便于复制、检索和核对。
- 抓取远程图像 URL 里的通知文本,作为自动化流程中的纯文本输入。
- 将本地 PDF 页面图片中的标题、正文提取出来,避免手动转录。
适合人员
- 处理客服工单的工程师,需要把截图中的报错信息转成可检索文本。
- 整理资料的分析师,需要把扫描文件照片里的字段文字提取出来。
- 做文档自动化的开发者,需要把远程图像或本地 PDF 页面变成纯文本。
- 核对票据信息的运营,需要把拍摄单据上的关键文字快速转录。