腾讯云实时文档抽取Agent
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-ocr-extractdocagent。
技能介绍
解决什么问题
在办公流程里,很多信息并不在结构化数据库里,而是散落在合同、发票、报告等图片或 PDF 单页中。人工录入不仅慢,还容易把字段抄错,尤其是键值对和表格字段混杂时,固定模板很难覆盖。腾讯云实时文档抽取Agent 解决的就是这个问题:给定一张图片或 PDF 单页,以及你关心的字段名,直接返回结构化 JSON。
技能如何工作
它调用腾讯云 OCR 的实时文档抽取接口,面向 30 秒以内、输入输出 Token 约 2000 以内的场景。核心输入包括:
ImageBase64或ImageUrl,二选一,支持 PNG、JPG、JPEG、BMP 和 PDF。ItemNames,即你要抽取的字段列表;每个字段可用KeyName指定名称,KeyType区分 KV 对(0) 和 表格字段(1),并可用KeyPrompt提供字段描述。PdfPageNumber,当输入是 PDF 时指定单页页码。
返回结果不是整段文本,而是按 GroupInfo、LineInfo、ItemInfo 组织的结构化数据,字段值可包含 AutoName、AutoContent、坐标、页码等信息。这个设计适合下游程序直接消费,而不需要再写正则去切分 OCR 文本。
边界与注意点
该技能更偏向“实时字段抽取”,不是通用长文档智能体。需要特别注意:图片/PDF 编码后不超过 10M,像素建议 20~10000px;PDF 只支持单页识别;ItemNames 不能为空;KV 和表格字段分别有数量上限;默认请求频率约 20 次/秒。若服务未开通、文件下载失败、图片解码失败或账号欠费,响应里通常会出现对应错误码,需要结合 ErrorCode 和 ErrorMessage 处理。
使用场景
- 核对供应商发票时,从发票图片中抽取金额、日期、税号等自定义字段并写入表格
- 处理合同扫描件单页时,提取甲乙方、金额、期限等键值对字段用于录入系统
- 读取报告单页中的表格字段,按自定义列名返回结构化数据,便于后续比对
- 对图片/PDF中的指定字段做实时抽取,在30秒内拿到 JSON 供业务系统校验
适合人员
- 财务/出纳:要把发票图片里的金额、税号、日期等字段批量录入台账
- 法务/商务助理:需要从合同扫描件单页提取甲乙方、金额、期限并归档
- 运营/数据录入:要把报告或单据中的表格字段按自定义列名结构化为 JSON
- 后端/自动化工程师:要在业务系统里按自定义字段名实时解析文档字段