讯飞大模型OCR图像理解
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bd0773b4/iflytek-bigmodel-ocr。
技能介绍
解决的问题
当需要从本地图片、截图或表格图中提取可读内容时,直接把图片路径交给该 skill,而不是手动复制 OCR 平台入口、整理凭证或写一次性脚本。它面向的是“图片已有、配置可用、结果要程序化”的办公场景,尤其适合后续把识别结果写入文档、表格或工单字段。
工作方式与边界
技能会先确认输入图片路径是否存在,再根据调用方式获取鉴权信息。配置优先级为:--api-key、--model-id、--base-url 等命令行参数最高,其次读取环境变量(默认 IFLYTEK_API_KEY),最后读取 --config 指定的 JSON 文件。assets/config.template.json 只是模板,不能直接当作真实凭证使用。执行后会直接返回 JSON 结果,必要时可解释 content 字段。
适用时注意:它处理的是用户提供的本地图片,识别文字、表格或截图内容;若需要自定义提示词,应通过参数传入,而不是修改 skill 包内文件。
使用场景
- 把截图里的审批字段识别成结构化 JSON,便于写入工单系统
- 读取本地表格图片中的行列内容,用于核对报销单据
- 将产品截图中的报错文本提取出来,作为排障记录附件
- 用 `--config` 传入固定模型配置,执行本地图片识别
适合人员
- 需要把截图文本转成 JSON 的客服系统开发
- 整理报销单据表格图片的财务运营
- 把产品报错截图归档成排障记录的测试工程师
- 用命令行参数管理凭证的自动化脚本作者