GPT Image 2 多模型生图
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_fdb96f95/gpt-image-2-1。
技能介绍
解决的问题
AI Agent 在生图时常常缺少统一入口:API 密钥可能来自环境变量或宿主配置,模型端点、尺寸、返回格式也不一致。若直接硬编码 OpenAI 端点,容易在网关、兼容接口或本地模型上失效。这个技能把生图收敛成可复用的 Agent 能力,让不同宿主按同一流程调用可用模型。
核心工作流
- API 发现:优先读取环境变量,再检查宿主配置(如
config.yaml、settings.json),定位可用的图像生成接口。 - 模型选择:按优先级尝试
gpt-image-2、dall-e-3、dalle-3、stable-diffusion-xl或任意可用模型,并验证端点支持。 - 提示词结构化:用
Subject / Action / Context / Composition / Lighting / Style组装提示词,减少“只给一个名词”导致的画面不稳定。 - 生成与保存:调用
/v1/images/generations,兼容b64_json或url返回,并把图片写入本地目录。 - 容错与记忆:处理
401、403、429、timeout等错误,使用指数退避重试,并记录 session 记忆。
适用边界
它适合已有 OpenAI 兼容生图 API、需要让 Agent 自动选择模型的场景。若宿主未配置任何 API,或端点不支持图像生成,仍会失败。使用时应注意不同模型尺寸限制,例如 gpt-image-2 支持 1024x1024、2048x1024,而 dall-e-3 常见为 1024x1024、1792x1024。
使用场景
- 在 Agent 工作流中,按优先级调用已配置的 GPT Image 2、DALL·E 3 或开源模型生成图片。
- 当宿主只暴露 OpenAI 兼容接口时,自动发现 API 端点、验证模型并保存 `b64_json` 或 URL 图片。
- 为机器人咖啡师等复杂画面生成提示词,按主体、动作、背景、镜头、光线、风格组织请求。
- 遇到 `429` 或 timeout 时,按指数退避重试并切换可用模型,记录操作笔记。
适合人员
- 需要让 AI Agent 自动选择可用生图模型并落盘结果的工程团队
- 维护 OpenAI 兼容网关配置、需要统一生图入口的 Agent 开发者
- 制作产品概念图、视觉素材,需要结构化提示词模板的设计协作工程师
- 处理 API 限流、超时或模型端点差异,需要稳定重试逻辑的后端工程师