Agent Skills
返回列表
智绘图片理解

智绘图片理解

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @ixhlink/ixhlink-skills-image-explain。

技能介绍

解决的具体问题

在图像驱动的应用中,如内容审核、数据分析或自动化工作流,需要从图片中提取结构化信息或进行语义理解。传统方法依赖复杂的预处理模型,而大模型提供了端到端的解决方案,但调用集成涉及 API 对齐、付费管理和错误处理。

智绘图片理解 技能封装了同步图片分析能力,允许开发者通过简单接口提交图片 URL 或 Base64 数据,返回文本形式的理解结果。这减少了自行搭建视觉模型的负担,尤其适用于需要快速集成图片分析功能的场景。

核心能力与工作流程

技能的核心是 vision 能力,以同步方式处理图片理解请求。关键步骤如下:

  1. 查询模型(可选):通过 GET /api/v1/llm/models 确认模型已启用。
  2. 提交请求:使用 POST /api/v1/llm/invoke 发送请求体,其中 messages 数组包含图片和文字内容。支持两种图片输入格式:

- URL 图片:在 image_url.url 中提供公网 https 链接。
- Base64 图片:使用 data:image/...;base64,... 格式。

  1. 处理付费:如果返回 HTTP 402,需调用支付接口,然后用相同 JSON body 重试,附加支付相关头信息如 WeixinPay-RequiredX-Payment-Id
  2. 解析响应:从 data.choices[0].message.content 提取模型回复文本。

请求体遵循 OpenAI 兼容格式,payload 字段包括:

  • messages:对话数组,支持 textimage_url 类型。
  • 可选参数:systemmax_tokenstemperature 等。

示例请求(URL 图片):

{
  "model": "ixhlink-skills-image-explain",
  "capability": "vision",
  "payload": {
    "messages": [
      {
        "role": "user",
        "content": [
          { "type": "text", "text": "描述这张图片" },
          { "type": "image_url", "image_url": { "url": "https://example.com/image.jpg" } }
        ]
      }
    ]
  }
}

注意事项与边界

  • 付费前置检查:调用前必须确保 Agent 已安装支付能力(如 weixinpay extension),否则提示并终止流程。服务定价为 0.3 元/次,需用户确认后进入付费。
  • 错误处理:常见 HTTP 错误包括:

- 400:参数错误,如缺少模型或消息格式无效。
- 402:需付费或支付失败。
- 404:模型未启用。
- 503:服务不可用。
排查时可使用 data._billing.call_log_id 查看日志。

  • 同步限制:技能为同步操作,适合低延迟场景;大量请求可能需要队列管理。
  • 图片格式:仅支持公网可访问的 URL 或 Base64 编码,本地文件需先上传。

使用场景

  • 电商平台运营需要批量分析商品图片,自动生成符合SEO标准的描述文案,用于上架发布。
  • 内容审核团队需对用户上传的图片进行合规性检查,快速识别并标记可能违规的视觉元素。
  • 技术文档工程师在编写手册时,需要为插入的架构图或流程图自动提取关键信息,生成可访问的替代文本。
  • 市场分析师从社交媒体广告图片中提取品牌标志、文字内容和情感倾向,用于竞品分析报告。

适合人员

  • 电商运营专员:每周需处理上百张新品图片,诉求是快速生成准确且吸引人的产品描述。
  • 内容安全审核员:每日审核数千张用户图片,诉求是高效识别违规内容以减少人工复核负担。
  • UX 设计师:在设计评审中需要快速解析截图中的交互细节,诉求是获取结构化反馈以优化界面。
  • 数据标注工程师:需为训练集中的图片生成详细文本标签,诉求是提升标注一致性和效率。