腾讯云广告文字识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-ocr-general。
技能介绍
要解决的具体问题
在图像处理、广告分析或自动化文档工作流中,经常需要从图片中提取文字信息。传统 OCR 工具在处理中英文混合文本、多方向排列(如竖排或倾斜)以及旋转图片时,往往识别准确率不足或无法提供精确的文本位置坐标,影响后续的视觉定位或交互设计。
技能如何工作
腾讯云广告文字识别接口针对上述问题提供了解决方案。其核心能力包括:
- 中英文识别:支持中英文混合文字的准确检测与识别,适用于多语言场景。
- 多方向支持:能够处理横排、竖排以及倾斜场景的文本,无需预先矫正。
- 翻转支持:支持 90 度、180 度、270 度翻转的图片,增强了处理灵活性。
- 坐标返回:返回每个文本行的四顶点坐标(
Polygon字段),以列表形式提供,便于视觉操作。 - 置信度评估:为每个识别结果提供置信度(0~100),帮助评估识别质量。
使用流程分为关键步骤:
- 输入图片:通过
ImageBase64(Base64 编码,不超过 10MB)或ImageUrl(推荐腾讯云 COS 地址)提供图片,两者必须至少提供一个。 - 调用接口:使用
tencentcloud-sdk-python库向 API 发送请求,处理频率默认限制为 20 次/秒。 - 解析响应:返回 JSON 结果,包含
TextDetections列表,其中每个条目有DetectedText(识别文本)、Confidence(置信度)和Polygon(坐标)等字段,以及TextCount、ImageSize等元信息。
适用边界与注意点
尽管功能强大,但使用时需注意:
- 请求限制:API 默认频率为 20 次/秒,高频场景需合理设计调用策略。
- 图片要求:支持 PNG、JPG、JPEG、BMP 格式,分辨率建议 600×800 以上以确保识别效果,编码后大小不超过 10MB。
- 环境配置:依赖 Python 3.6+ 和
tencentcloud-sdk-python库,并需设置环境变量TENCENTCLOUD_SECRET_ID和TENCENTCLOUD_SECRET_KEY以使用 API 密钥。 - 错误处理:根据错误码(如
FailedOperation.ImageNoText表示图片无文本,LimitExceeded.TooLargeFileError表示文件过大)进行异常处理,避免服务中断。 - 计费与资源:接口始终计费,需监控资源使用,防止欠费或资源包耗尽(如错误码
ResourceUnavailable.InArrears)。
通过理解这些要点,开发者可以高效集成该技能,实现可靠的图片文字识别功能。
使用场景
- 从电商广告横幅图片中提取中英文促销文案,用于自动生成商品描述或分析营销趋势。
- 识别社交媒体广告图片中的多方向文字(如竖排标题),获取坐标信息以优化广告布局设计。
- 处理扫描的纸质广告文档图片,识别倾斜或翻转的文本内容,实现自动化信息录入系统。
- 提取设计稿截图中的文本行及置信度,帮助前端团队验证UI元素位置并进行交互开发。
适合人员
- 广告数据分析师:需要定期从多个图片广告中批量提取文字,用于市场竞品分析和效果评估。
- UI/UX设计师:在迭代设计稿时,必须获取文本的精确坐标以确保视觉元素对齐和交互准确性。
- 内容合规审核员:负责检查图片中是否有违规广告文字,依赖OCR快速识别并生成审核报告。