翔云 OCR 表格与文档识别 Pro
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6b190ef3/xiangyun-table-ocr。
技能介绍
解决的问题
很多办公文档以图片或扫描 PDF 形式存在,文字、表格、版面混排,直接复制会得到乱序文本或丢失单元格关系。若需要把财报、合同、试卷或发票转成可编辑材料,通常需要手工重排。
技能如何工作
该技能封装翔云 OCR 的通用文档识别接口,使用 typeId: 3050 对图片、PDF、扫描件中的文字、表格和版面结构做一体化识别。它先从 config.json、环境变量 NETOCR_KEY / NETOCR_SECRET 或用户输入中加载凭据,再读取本地文件、拖入文件或目录批量处理。识别时可按内容选择 nLanguage,例如英文为 2、日文为 11;对表格、多栏报告建议开启 layout: 1。遇到歪斜扫描件时可启用 autoRotation 与 inclineCorrect,背景干扰时可配合 removeWaterMark、filterColor。识别成功后会返回 consumeId,先以 Markdown 预览内容;当用户明确提出导出时,再调用下载接口获取 xls、flowWord、boxWord、md、pdf、txt 或 ofd 文件。
适用边界与注意点
该技能依赖云端 OCR 服务,识别阶段会向 netocr.com 发送图片和 API 凭据,因此不适合处理不可外发的高敏感材料。输入质量会影响结果:扫描件建议 300DPI 且小于 3M,普通图像约 200KB;常见格式包括 PNG、JPG、JPEG、WEBP、TIF、OFD、PDF。consumeId 有过期风险,下载失败时通常需重新识别。导出格式也有差异:xls 适合数据处理,boxWord 更偏向保留排版,flowWord 适合正文编辑,md 适合文档转换。多语言混排时应显式选择主要语言,避免默认简体中文造成误识别。
使用场景
- 把财务报表扫描件识别为可编辑表格,并导出 Excel 用于后续核算。
- 将含表格的合同或报告 PDF 提取为 Word/Markdown,方便检索条款和修改正文。
- 批量识别文件夹中的发票或手写稿图片,提取文字并导出 TXT 做归档。
- 识别歪斜扫描件或多栏试卷,开启版面分析后导出双层 PDF 或 Word 保留版式。
适合人员
- 财务助理:需要把对账单、财报扫描件识别成 Excel 表格再核对数据。
- 法务或行政:需要把合同、报告 PDF 的文字和表格提取出来编辑或归档。
- 数据分析师:需要从报表、工程量表扫描件中提取结构化表格供后续清洗。
- 档案管理员:需要批量识别发票、证件图片并导出 TXT 或双层 PDF 存档。