Agent Skills
返回列表
🎨

文本识别 OCR

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_628f4cb3/ocr。

技能介绍

问题

图像里的文字常常以低分辨率截图、拍摄文档、广告牌照片等形式出现。工程侧要处理的不是单一模型调用,而是输入格式、鉴权、参数缺失和返回数据整理等流程问题。

工作方式

文本识别OCR 以图像输入为起点,自动检测并识别其中的文本内容,适合文档、广告牌、屏幕截图等场景。其调用路径通常分为三步:

  • 选择工具:图片链接使用 scripts.tools.ocr,Base64 图片数据使用 scripts.tools.ocr_for_data_base64。
  • 补齐参数:ocr 需要 dataUrl,ocr_for_data_base64 需要 dataBase64;参数不完整时应先向用户确认。
  • 整理结果:返回对象包含 success、message 和 raw,其中 raw 是 API 原始数据,可直接用于展示或后续处理。

适用边界

该技能要求配置 XBY_APIKEY。缺少密钥时应询问用户,不应自行编造识别结果。它适合图片 URL 或 Base64 输入;本地私有文件需要先转换为可访问链接或 Base64 数据。若 success 为 false,应结合 message 与 raw 判断失败原因。

使用场景

  • 把报错截图粘贴到工单前,用图片 URL 提取其中的错误码和堆栈文本。
  • 将客户上传的 Base64 合同图片转为可编辑文字,便于核对条款字段。
  • 拍摄门店广告牌后,识别招牌名称和电话号码,生成录入表格的字段。
  • 从屏幕截图里提取控制台日志中的参数名和值,用于复现问题。

适合人员

  • 需要在工单中留存的客服工程师:从报错截图里提取错误码、参数和日志文本。
  • 处理客户上传资料的运营:把合同或凭证图片转成可编辑文字,便于填写字段。
  • 整理线下门店信息的市场人员:识别广告牌上的店名、电话和地址,生成录入数据。
  • 复现前端问题的测试工程师:从屏幕截图中提取控制台参数、报错信息和请求值。