Agent Skills
返回列表
PaddleOCR 文档解析

PaddleOCR 文档解析

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-paddleocr-doc-parsing

技能介绍

要解决的问题

很多办公文档不是纯文本:发票、财报、电子表格、论文、多栏资料里混有表格、公式、图表和版面关系。直接读取文字容易丢失行列结构、公式语义、图表位置,也无法稳定处理弯曲、折叠或方向错误的扫描件。

技能如何工作

该技能面向 PaddleOCR 文档解析场景,支持从 URL 或本地文件启动解析。核心是围绕复杂版面做内容抽取:表格、公式、图表、多栏布局 与整体结构分析。对平整截图或方向正常的扫描件,可以关闭预处理以获得更快速结果;对弯曲折叠、透视变形或旋转输入,则保留预处理,让系统先校正图像再解析。

输出上,技能要求尽量展示完整抽取内容,仅在超过约 10,000 字符时截断;多页内容可按需总结,但用户明确要求完整时仍给全量结果。

适用边界

它适合需要结构化读取的办公文档,不适合作为普通 OCR 简单文字识别使用。若 PADDLEOCR_ACCESS_TOKEN 缺失、无效,或触发 API 配额,需要把具体错误反馈给用户,而不是静默失败。空白页、无可提取文本、低质量扫描也可能导致无内容结果。

使用场景

  • 把发票、财报截图解析成结构化表格,便于核对金额、科目和行列关系。
  • 阅读论文或技术报告时,提取数学公式并保留其与正文的上下文。
  • 整理新闻、宣传册等多栏资料,按版面还原文字阅读顺序。
  • 从图表说明页提取图表相关文字,供后续人工核对数据。

适合人员

  • 负责报销或财务核对,要把发票和报表里的表格逐项整理清楚的财务。
  • 写论文或整理技术资料,需要准确提取公式和段落上下文的科研人员。
  • 做竞品资料归档,要把宣传册、新闻多栏内容转成可读文本的分析师。
  • 集成文档解析流水线,需要处理 URL、本地扫描件并暴露具体错误的工程师。