Agent Skills
返回列表
腾讯云实时文档抽取Agent

腾讯云实时文档抽取Agent

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-ocr-extractdocagent。

技能介绍

解决什么问题

在办公流程里,很多信息并不在结构化数据库里,而是散落在合同、发票、报告等图片或 PDF 单页中。人工录入不仅慢,还容易把字段抄错,尤其是键值对和表格字段混杂时,固定模板很难覆盖。腾讯云实时文档抽取Agent 解决的就是这个问题:给定一张图片或 PDF 单页,以及你关心的字段名,直接返回结构化 JSON。

技能如何工作

它调用腾讯云 OCR 的实时文档抽取接口,面向 30 秒以内、输入输出 Token 约 2000 以内的场景。核心输入包括:

  • ImageBase64 或 ImageUrl,二选一,支持 PNG、JPG、JPEG、BMP 和 PDF。
  • ItemNames,即你要抽取的字段列表;每个字段可用 KeyName 指定名称,KeyType 区分 KV 对(0) 和 表格字段(1),并可用 KeyPrompt 提供字段描述。
  • PdfPageNumber,当输入是 PDF 时指定单页页码。

返回结果不是整段文本,而是按 GroupInfo、LineInfo、ItemInfo 组织的结构化数据,字段值可包含 AutoName、AutoContent、坐标、页码等信息。这个设计适合下游程序直接消费,而不需要再写正则去切分 OCR 文本。

边界与注意点

该技能更偏向“实时字段抽取”,不是通用长文档智能体。需要特别注意:图片/PDF 编码后不超过 10M,像素建议 20~10000px;PDF 只支持单页识别;ItemNames 不能为空;KV 和表格字段分别有数量上限;默认请求频率约 20 次/秒。若服务未开通、文件下载失败、图片解码失败或账号欠费,响应里通常会出现对应错误码,需要结合 ErrorCode 和 ErrorMessage 处理。

使用场景

  • 核对供应商发票时,从发票图片中抽取金额、日期、税号等自定义字段并写入表格
  • 处理合同扫描件单页时,提取甲乙方、金额、期限等键值对字段用于录入系统
  • 读取报告单页中的表格字段,按自定义列名返回结构化数据,便于后续比对
  • 对图片/PDF中的指定字段做实时抽取,在30秒内拿到 JSON 供业务系统校验

适合人员

  • 财务/出纳:要把发票图片里的金额、税号、日期等字段批量录入台账
  • 法务/商务助理:需要从合同扫描件单页提取甲乙方、金额、期限并归档
  • 运营/数据录入:要把报告或单据中的表格字段按自定义列名结构化为 JSON
  • 后端/自动化工程师:要在业务系统里按自定义字段名实时解析文档字段