Agent Skills
返回列表
腾讯云文字识别(通用高精度版)

腾讯云文字识别(通用高精度版)

知识管理 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-ocr。

技能介绍

问题背景

在工程实践中,处理非结构化文档数据是一个高频且棘手的任务。开发者经常需要从扫描件、照片、截图或 PDF 中提取文字信息,用于存档、分析或系统对接。传统的 OCR 方案可能面临准确率不高、对复杂排版或低质量图片处理能力弱、无法有效识别特定结构(如简历)等问题。

核心能力与实现

该技能封装了腾讯云 OCR 的 GeneralAccurateOCR 接口,主要提供以下核心能力:

  • 高精度通用文字识别:对图片中的文字进行精准提取,即使图片质量一般,也能返回结构化的文本内容。
  • PDF 文件直接解析:无需将 PDF 转换为图片,支持通过 IsPdf 参数直接识别 PDF 文件指定页码(PdfPageNumber)的内容。
  • 细粒度位置与置信度:可选开启 IsWords 参数,返回每个识别出的单字在图片中的坐标位置和置信度分数,这对于需要精确定位或分析识别质量的场景很有价值。
  • 结构化信息提取扩展:基于 OCR 结果,技能提供对多语种简历进行结构化提取的能力,将非结构化的简历图片或 PDF 转化为格式化的数据,这超出了纯文字提取的范畴。

技能的工作流相对直接:通过 scripts/main.py 脚本发起请求,核心是构造包含 ImageBase64ImageUrl 的 JSON 参数调用腾讯云 API。脚本会自动处理 UserAgent 参数的探测与注入,用于渠道统计,不影响主流程。

适用边界与注意点

在使用前,需要明确几点:

  • 单页处理:对于 PDF,每次请求仅能识别指定的单页内容,识别多页需循环调用。
  • 输入限制:图片 Base64 大小不超过 10MB。请确保网络环境能稳定访问腾讯云 API 端点。
  • 角色依赖:技能的运行完全依赖腾讯云 OCR 服务,需要有效的 API 密钥(TENCENTCLOUD_SECRET_IDTENCENTCLOUD_SECRET_KEY),并已购买相应服务。
  • 非实时场景:此为服务端识别,网络延迟和 API 限流可能影响响应速度,不适用于毫秒级延迟要求的实时场景。

使用场景

  • 将纸质合同、发票的扫描图片上传后,调用该技能精准提取其中的条款、金额、日期等关键文本信息,用于后续数据录入或审核。
  • 需要从一批 PDF 格式的学术论文或报告中,快速提取每页的正文内容,进行文本分析或信息检索,而无需手动复制粘贴。
  • 在收到大量求职者发送的简历图片或 PDF 后,使用该技能自动识别并结构化提取姓名、教育经历、工作年限等字段,以便导入招聘系统进行初步筛选。
  • 对历史档案中模糊不清的文档照片进行高精度 OCR,以恢复可编辑的电子文本,用于资料数字化和内容存档。

适合人员

  • 负责将大量纸质文档电子化归档的档案管理员,需要高效准确地获取文档中的文字内容。
  • 每周处理数十份求职简历的招聘专员,希望从图片或 PDF 格式的简历中快速提取结构化信息以进行筛选。
  • 需要从合同、标书等非结构化文档图片中提取关键条款和数据,用于法律或财务分析的助理。
  • 研究人员或数据分析师,需要批量处理 PDF 文档以提取纯文本,用于语料库构建或内容挖掘。