智绘文字识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @ixhlink/ixhlink-skills-ocr-recog。
技能介绍
适用问题
当 Agent 需要从截图、扫描件、PDF 页图、聊天图片中提取文字时,通常要处理三个工程问题:图片如何稳定传入、长耗时识别如何异步跟踪、识别结果如何按用户意图清洗。智绘文字识别把 OCR 封装成 OpenAI 兼容的对话接口,输入图片和 Prompt,输出可继续处理的结构化文本。
工作方式
- 调用模型:默认走
POST /api/v1/llm/invoke,也可用POST /api/v1/llm/tasks强制异步。OCR 是慢任务,需要取data.task.id并轮询GET /api/v1/llm/tasks/{task_id},直到status = succeeded。 - 图片传入:优先使用真实可访问的
https://...图片地址,放在user.content[]的image_url中。若只有 Base64,可用data:image/png;base64,...或裸b64字段,但依赖后台开启 Base64 转 OSS。 - Prompt 控制:
system消息承载识别意图,如OCR this image.、Convert the document to markdown.;user消息只放图片。输出在choices[0].message.content,可能包含布局标注,需要按场景清洗。 - 付费与错误:按次计费,未支付会返回
402,客户端用相同请求体和支付 Header 重试;常见400、404、503多与图片地址、模型启用或服务状态有关。
注意点
适合图片文字提取、文档转 Markdown、图表解析、关键词定位等场景。不适合把示例占位符、相对路径或脱敏日志当作真实图片提交;Base64 体积较大时,建议先写 JSON 文件再提交,避免 shell 截断。
使用场景
- 把产品截图里的报错文字转成可检索文本,方便写入事故记录。
- 将扫描合同首页图片识别成 Markdown,保留条款结构后再做摘要。
- 从仪表盘图片中定位关键词并提取数值,用于核对报表。
- 把会议白板照片中的纯文字清单转成文本,供后续任务拆解。
适合人员
- 需要把客户聊天截图转成文本再归档的客服系统工程师
- 要处理大量扫描单据图片并提取字段数据的后端工程师
- 希望让 Agent 自动读取图片报错信息并写入日志的运维工程师
- 需要将图表截图中的指标定位提取到报表中的数据分析工程师