Agent Skills
返回列表
智绘文字识别

智绘文字识别

办公效率 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @ixhlink/ixhlink-skills-ocr-recog。

技能介绍

适用问题

当 Agent 需要从截图、扫描件、PDF 页图、聊天图片中提取文字时,通常要处理三个工程问题:图片如何稳定传入、长耗时识别如何异步跟踪、识别结果如何按用户意图清洗。智绘文字识别把 OCR 封装成 OpenAI 兼容的对话接口,输入图片和 Prompt,输出可继续处理的结构化文本。

工作方式

  • 调用模型:默认走 POST /api/v1/llm/invoke,也可用 POST /api/v1/llm/tasks 强制异步。OCR 是慢任务,需要取 data.task.id 并轮询 GET /api/v1/llm/tasks/{task_id},直到 status = succeeded。
  • 图片传入:优先使用真实可访问的 https://... 图片地址,放在 user.content[] 的 image_url 中。若只有 Base64,可用 data:image/png;base64,... 或裸 b64 字段,但依赖后台开启 Base64 转 OSS。
  • Prompt 控制:system 消息承载识别意图,如 OCR this image.、Convert the document to markdown.;user 消息只放图片。输出在 choices[0].message.content,可能包含布局标注,需要按场景清洗。
  • 付费与错误:按次计费,未支付会返回 402,客户端用相同请求体和支付 Header 重试;常见 400、404、503 多与图片地址、模型启用或服务状态有关。

注意点

适合图片文字提取、文档转 Markdown、图表解析、关键词定位等场景。不适合把示例占位符、相对路径或脱敏日志当作真实图片提交;Base64 体积较大时,建议先写 JSON 文件再提交,避免 shell 截断。

使用场景

  • 把产品截图里的报错文字转成可检索文本,方便写入事故记录。
  • 将扫描合同首页图片识别成 Markdown,保留条款结构后再做摘要。
  • 从仪表盘图片中定位关键词并提取数值,用于核对报表。
  • 把会议白板照片中的纯文字清单转成文本,供后续任务拆解。

适合人员

  • 需要把客户聊天截图转成文本再归档的客服系统工程师
  • 要处理大量扫描单据图片并提取字段数据的后端工程师
  • 希望让 Agent 自动读取图片报错信息并写入日志的运维工程师
  • 需要将图表截图中的指标定位提取到报表中的数据分析工程师