Agent Skills
返回列表
腾讯云广告文字识别

腾讯云广告文字识别

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-ocr-general。

技能介绍

要解决的具体问题

在图像处理、广告分析或自动化文档工作流中,经常需要从图片中提取文字信息。传统 OCR 工具在处理中英文混合文本、多方向排列(如竖排或倾斜)以及旋转图片时,往往识别准确率不足或无法提供精确的文本位置坐标,影响后续的视觉定位或交互设计。

技能如何工作

腾讯云广告文字识别接口针对上述问题提供了解决方案。其核心能力包括:

  • 中英文识别:支持中英文混合文字的准确检测与识别,适用于多语言场景。
  • 多方向支持:能够处理横排、竖排以及倾斜场景的文本,无需预先矫正。
  • 翻转支持:支持 90 度、180 度、270 度翻转的图片,增强了处理灵活性。
  • 坐标返回:返回每个文本行的四顶点坐标(Polygon 字段),以列表形式提供,便于视觉操作。
  • 置信度评估:为每个识别结果提供置信度(0~100),帮助评估识别质量。

使用流程分为关键步骤:

  1. 输入图片:通过 ImageBase64(Base64 编码,不超过 10MB)或 ImageUrl(推荐腾讯云 COS 地址)提供图片,两者必须至少提供一个。
  2. 调用接口:使用 tencentcloud-sdk-python 库向 API 发送请求,处理频率默认限制为 20 次/秒。
  3. 解析响应:返回 JSON 结果,包含 TextDetections 列表,其中每个条目有 DetectedText(识别文本)、Confidence(置信度)和 Polygon(坐标)等字段,以及 TextCountImageSize 等元信息。

适用边界与注意点

尽管功能强大,但使用时需注意:

  • 请求限制:API 默认频率为 20 次/秒,高频场景需合理设计调用策略。
  • 图片要求:支持 PNG、JPG、JPEG、BMP 格式,分辨率建议 600×800 以上以确保识别效果,编码后大小不超过 10MB。
  • 环境配置:依赖 Python 3.6+ 和 tencentcloud-sdk-python 库,并需设置环境变量 TENCENTCLOUD_SECRET_IDTENCENTCLOUD_SECRET_KEY 以使用 API 密钥。
  • 错误处理:根据错误码(如 FailedOperation.ImageNoText 表示图片无文本,LimitExceeded.TooLargeFileError 表示文件过大)进行异常处理,避免服务中断。
  • 计费与资源:接口始终计费,需监控资源使用,防止欠费或资源包耗尽(如错误码 ResourceUnavailable.InArrears)。

通过理解这些要点,开发者可以高效集成该技能,实现可靠的图片文字识别功能。

使用场景

  • 从电商广告横幅图片中提取中英文促销文案,用于自动生成商品描述或分析营销趋势。
  • 识别社交媒体广告图片中的多方向文字(如竖排标题),获取坐标信息以优化广告布局设计。
  • 处理扫描的纸质广告文档图片,识别倾斜或翻转的文本内容,实现自动化信息录入系统。
  • 提取设计稿截图中的文本行及置信度,帮助前端团队验证UI元素位置并进行交互开发。

适合人员

  • 广告数据分析师:需要定期从多个图片广告中批量提取文字,用于市场竞品分析和效果评估。
  • UI/UX设计师:在迭代设计稿时,必须获取文本的精确坐标以确保视觉元素对齐和交互准确性。
  • 内容合规审核员:负责检查图片中是否有违规广告文字,依赖OCR快速识别并生成审核报告。