Agent Skills
返回列表
讯飞大模型OCR图像理解

讯飞大模型OCR图像理解

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bd0773b4/iflytek-bigmodel-ocr。

技能介绍

解决的问题

当需要从本地图片、截图或表格图中提取可读内容时,直接把图片路径交给该 skill,而不是手动复制 OCR 平台入口、整理凭证或写一次性脚本。它面向的是“图片已有、配置可用、结果要程序化”的办公场景,尤其适合后续把识别结果写入文档、表格或工单字段。

工作方式与边界

技能会先确认输入图片路径是否存在,再根据调用方式获取鉴权信息。配置优先级为:--api-key、--model-id、--base-url 等命令行参数最高,其次读取环境变量(默认 IFLYTEK_API_KEY),最后读取 --config 指定的 JSON 文件。assets/config.template.json 只是模板,不能直接当作真实凭证使用。执行后会直接返回 JSON 结果,必要时可解释 content 字段。

适用时注意:它处理的是用户提供的本地图片,识别文字、表格或截图内容;若需要自定义提示词,应通过参数传入,而不是修改 skill 包内文件。

使用场景

  • 把截图里的审批字段识别成结构化 JSON,便于写入工单系统
  • 读取本地表格图片中的行列内容,用于核对报销单据
  • 将产品截图中的报错文本提取出来,作为排障记录附件
  • 用 `--config` 传入固定模型配置,执行本地图片识别

适合人员

  • 需要把截图文本转成 JSON 的客服系统开发
  • 整理报销单据表格图片的财务运营
  • 把产品报错截图归档成排障记录的测试工程师
  • 用命令行参数管理凭证的自动化脚本作者