全能文字识别
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @ixhlink/ixhlink-skills-quanneng-ocr-recog。
技能介绍
问题
图片中的文字常以截图、扫描件、表格、图表形式存在。手工转录不稳定,普通 OCR 有时只能给纯文本,丢失布局,或者无法处理文档转 Markdown、图表解析、关键词定位等场景。这里需要的是一个明确的 OCR 调用路径,能把图片变成可编辑文本,同时保留足够结构信息供后续清洗。
工作方式
全能文字识别把 OCR 暴露为异步接口。先提交 POST /api/v1/llm/invoke 或任务接口,传入 OpenAI 兼容的 messages:system 写场景 Prompt,user 只放 image_url。图片可用公网 https:// 链接,也可用完整 data: Base64 或裸 b64。请求返回 task_id 后轮询任务,直到 succeeded,再从 choices[0].message.content 读取结果。
- 文档转 Markdown:保留页面结构。
- 普通 OCR:提取纯文字。
- 图表解析:处理示意图和图表内容。
- 关键词定位:在图中定位指定词。
输出可能包含布局标注,需要按下游展示或检索需求清洗标记。
注意边界
Base64 提交必须真实可解码,不能保留示例占位符;如果模型未开启后端转 OSS,Base64 可能失败。公网图优先,避免 shell 截断超长 Base64。该能力按次计费,402 后需按返回的支付标识原样重试。适合工程化图片文字提取、文档 Markdown 化、截图内容结构化;不适合需要离线部署、批量大文件秒级返回或未配置图片访问权限的场景。
使用场景
- 收到供应商 PDF 截图,需要把表格和正文提取成可编辑文本并交给后续解析。
- 客服把用户投诉截图丢进工单,需要快速识别图中订单号、金额和关键描述。
- 研究员要把论文图表中的坐标和标注提取出来,先得到结构化文字再人工校对。
- 运营要把活动海报上的文案、价格和时间提取到表格,用于后续活动复盘。
适合人员
- 负责工单处理的客服主管,需要把客户截图中的订单号和诉求转成结构化文本。
- 做合同初审的法务助理,需要识别扫描合同中的金额、日期和签署条款。
- 维护产品文档的技术写作者,需要把界面截图里的菜单和提示文本提取成 Markdown。
- 整理调研资料的分析师,需要批量识别海报、论文图表和表格截图中的文字。