智绘图片理解
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @ixhlink/ixhlink-skills-image-explain。
技能介绍
解决的具体问题
在图像驱动的应用中,如内容审核、数据分析或自动化工作流,需要从图片中提取结构化信息或进行语义理解。传统方法依赖复杂的预处理模型,而大模型提供了端到端的解决方案,但调用集成涉及 API 对齐、付费管理和错误处理。
智绘图片理解 技能封装了同步图片分析能力,允许开发者通过简单接口提交图片 URL 或 Base64 数据,返回文本形式的理解结果。这减少了自行搭建视觉模型的负担,尤其适用于需要快速集成图片分析功能的场景。
核心能力与工作流程
技能的核心是 vision 能力,以同步方式处理图片理解请求。关键步骤如下:
- 查询模型(可选):通过
GET /api/v1/llm/models确认模型已启用。 - 提交请求:使用
POST /api/v1/llm/invoke发送请求体,其中messages数组包含图片和文字内容。支持两种图片输入格式:
- URL 图片:在 image_url.url 中提供公网 https 链接。
- Base64 图片:使用 data:image/...;base64,... 格式。
- 处理付费:如果返回 HTTP 402,需调用支付接口,然后用相同 JSON body 重试,附加支付相关头信息如
WeixinPay-Required和X-Payment-Id。 - 解析响应:从
data.choices[0].message.content提取模型回复文本。
请求体遵循 OpenAI 兼容格式,payload 字段包括:
messages:对话数组,支持text和image_url类型。- 可选参数:
system、max_tokens、temperature等。
示例请求(URL 图片):
{
"model": "ixhlink-skills-image-explain",
"capability": "vision",
"payload": {
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "描述这张图片" },
{ "type": "image_url", "image_url": { "url": "https://example.com/image.jpg" } }
]
}
]
}
}
注意事项与边界
- 付费前置检查:调用前必须确保 Agent 已安装支付能力(如
weixinpay extension),否则提示并终止流程。服务定价为 0.3 元/次,需用户确认后进入付费。 - 错误处理:常见 HTTP 错误包括:
- 400:参数错误,如缺少模型或消息格式无效。
- 402:需付费或支付失败。
- 404:模型未启用。
- 503:服务不可用。
排查时可使用 data._billing.call_log_id 查看日志。
- 同步限制:技能为同步操作,适合低延迟场景;大量请求可能需要队列管理。
- 图片格式:仅支持公网可访问的 URL 或 Base64 编码,本地文件需先上传。
使用场景
- 电商平台运营需要批量分析商品图片,自动生成符合SEO标准的描述文案,用于上架发布。
- 内容审核团队需对用户上传的图片进行合规性检查,快速识别并标记可能违规的视觉元素。
- 技术文档工程师在编写手册时,需要为插入的架构图或流程图自动提取关键信息,生成可访问的替代文本。
- 市场分析师从社交媒体广告图片中提取品牌标志、文字内容和情感倾向,用于竞品分析报告。
适合人员
- 电商运营专员:每周需处理上百张新品图片,诉求是快速生成准确且吸引人的产品描述。
- 内容安全审核员:每日审核数千张用户图片,诉求是高效识别违规内容以减少人工复核负担。
- UX 设计师:在设计评审中需要快速解析截图中的交互细节,诉求是获取结构化反馈以优化界面。
- 数据标注工程师:需为训练集中的图片生成详细文本标签,诉求是提升标注一致性和效率。