Agent Skills
返回列表
PaddleOCR 文本识别

PaddleOCR 文本识别

知识管理 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-paddleocr-text-recognition 到 AI 助手中。

技能介绍

适合解决什么问题

当需要把截图、照片、扫描件、PDF 页面或图像 URL 中的文字提取为 line/box 级别文本时,这个技能用于调用 PaddleOCR API 做基础 OCR。它不是文档解析:遇到表格、公式、图表、复杂版式时,不应把它作为首选。

技能如何工作

技能围绕一个明确边界展开:输入是图像或 PDF,目标是得到可读文本,而不是结构化文档。常见用法包括:

  • 从 URL 获取图像/PDF 并识别文字
  • 从 本地文件 读取图像/PDF 并识别文字
  • 在 CLI 层通过 paddleocr api --help 查看输出格式与参数

默认情况下,API 会启用文档预处理,包括 unwarping 和 orientation classification,因此对拍摄弯曲、折叠、透视明显或方向不确定的文档更稳。对于截图、扫描端正、方向明确的图片,可以关闭预处理以获得更快结果。

适用边界与注意点

  • 不要用 于复杂表格、公式、图表或多版式文档解析
  • 结果应完整展示给用户,除非内容超过 10000 字符,不要随意用省略号截断
  • 错误要具体反馈:PADDLEOCR_ACCESS_TOKEN 缺失/无效、API 配额受限、图片无文本等
  • 多页文档可摘要,但用户明确要求完整结果时应提供完整内容

使用场景

  • 收到含产品参数、错误提示的截图,需要快速提取可见文字用于工单排查。
  • 把扫描合同单页照片中的条款文字转出,便于复制、检索和核对。
  • 抓取远程图像 URL 里的通知文本,作为自动化流程中的纯文本输入。
  • 将本地 PDF 页面图片中的标题、正文提取出来,避免手动转录。

适合人员

  • 处理客服工单的工程师,需要把截图中的报错信息转成可检索文本。
  • 整理资料的分析师,需要把扫描文件照片里的字段文字提取出来。
  • 做文档自动化的开发者,需要把远程图像或本地 PDF 页面变成纯文本。
  • 核对票据信息的运营,需要把拍摄单据上的关键文字快速转录。