腾讯云表格识别V3
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-ocr-recognizetableaccurate。
技能介绍
从图像或PDF中提取表格数据是办公自动化和数据分析中的常见需求。传统OCR工具往往只能识别散乱文本,无法保留表格的行列结构,导致提取结果混乱,需要大量手动整理。
解决的问题
在处理文档时,表格数据提取常面临挑战:无线表格(无边框)难以检测边界,多表格混合或嵌套场景容易识别错误,旋转图像更增加复杂度。腾讯云表格识别V3专门解决这些问题,支持中英文图片/PDF内多种表格类型的精准识别,并返回结构化数据。
核心能力与工作原理
技能基于腾讯云OCR API,提供以下核心能力:
- 常规表格识别:精准识别有边框的表格。
- 无线表格识别:检测无边框表格并提取内容。
- 多表格识别:单张图像中识别多个独立表格。
- 嵌套表格识别:处理有线表格中包含无线表格的复杂场景。
- 旋转表格识别:支持任意角度旋转的表格图像。
- Excel导出:识别结果可直接转换为Excel文件(Base64编码)。
- PDF支持:支持PDF文件的单页表格识别。
工作原理:通过调用RecognizeTableAccurateOCR接口,输入参数如ImageBase64(图像Base64编码)或ImageUrl(图像URL),返回JSON格式结果,包含Cells列表(每个单元格的文本、坐标、置信度)和TableCoordPoint(表格顶点坐标)。用户可通过scripts/main.py脚本运行,或直接使用tencentcloud-sdk-python库调用。
使用注意事项
- 环境要求:需Python 3.6+,安装依赖
tencentcloud-sdk-python,并设置环境变量TENCENTCLOUD_SECRET_ID和TENCENTCLOUD_SECRET_KEY。 - 输入限制:图像/PDF编码后不超过10MB,分辨率建议600x800以上,长宽比小于3。支持格式:PNG、JPG、JPEG、BMP、PDF(单页识别)。
- API频率:默认请求频率限制为2次/秒,超出可能触发限流。
- 错误处理:常见错误包括
FailedOperation.ImageDecodeFailed(图片解码失败)、FailedOperation.ImageSizeTooLarge(尺寸过大)等,需根据错误码调试。 - 最佳实践:建议将图像存储于腾讯云COS以提升下载稳定性,复杂表格可优先处理高分辨率图像。
使用场景
- 在财务部门处理扫描的报销单图片时,需要提取其中的表格数据以自动录入财务系统并减少手工输入错误。
- 法律团队收到 PDF 格式的合同文件,需要识别条款表格并导出为 Excel 以进行批量审查和条款对比。
- 数据分析师面对包含多表格的市场调查图片,需要将其转换为结构化 Excel 数据以便进行统计分析和可视化。
- 办公文员处理带有嵌套表格的订单图片,需要准确识别单元格内容并导出为 Excel 以更新库存记录。
适合人员
- 财务审计师:需要从扫描的财务报表中提取表格数据以进行核对和生成汇总报告。
- 数据分析师:需要将 PDF 报告中的表格转换为 Excel 文件以便进行数据清洗、建模和进一步分析。
- 办公室文档管理员:需要处理包含无线表格或嵌套表格的图片,准确识别内容以自动化归档流程。
- 销售运营专员:需要从客户订单图片中提取多表格数据并整合到 Excel 中以跟踪销售绩效。