PaddleOCR 文档解析
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-paddleocr-doc-parsing
技能介绍
要解决的问题
很多办公文档不是纯文本:发票、财报、电子表格、论文、多栏资料里混有表格、公式、图表和版面关系。直接读取文字容易丢失行列结构、公式语义、图表位置,也无法稳定处理弯曲、折叠或方向错误的扫描件。
技能如何工作
该技能面向 PaddleOCR 文档解析场景,支持从 URL 或本地文件启动解析。核心是围绕复杂版面做内容抽取:表格、公式、图表、多栏布局 与整体结构分析。对平整截图或方向正常的扫描件,可以关闭预处理以获得更快速结果;对弯曲折叠、透视变形或旋转输入,则保留预处理,让系统先校正图像再解析。
输出上,技能要求尽量展示完整抽取内容,仅在超过约 10,000 字符时截断;多页内容可按需总结,但用户明确要求完整时仍给全量结果。
适用边界
它适合需要结构化读取的办公文档,不适合作为普通 OCR 简单文字识别使用。若 PADDLEOCR_ACCESS_TOKEN 缺失、无效,或触发 API 配额,需要把具体错误反馈给用户,而不是静默失败。空白页、无可提取文本、低质量扫描也可能导致无内容结果。
使用场景
- 把发票、财报截图解析成结构化表格,便于核对金额、科目和行列关系。
- 阅读论文或技术报告时,提取数学公式并保留其与正文的上下文。
- 整理新闻、宣传册等多栏资料,按版面还原文字阅读顺序。
- 从图表说明页提取图表相关文字,供后续人工核对数据。
适合人员
- 负责报销或财务核对,要把发票和报表里的表格逐项整理清楚的财务。
- 写论文或整理技术资料,需要准确提取公式和段落上下文的科研人员。
- 做竞品资料归档,要把宣传册、新闻多栏内容转成可读文本的分析师。
- 集成文档解析流水线,需要处理 URL、本地扫描件并暴露具体错误的工程师。