Agent Skills
返回列表
豆包图像生成

豆包图像生成

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_1707615b/t-h-i-n-g-o-2026 到你的 AI 助手中。

技能介绍

问题

这个技能解决的是一个具体痛点:开发者或智能体已经有一个 OpenAI 兼容的 Doubao Seedream 中转站,但不想每次都手动拼 images/generations 请求、处理 base64 参考图、下载远程图片、重试网络错误,还要保证结果能被下游脚本直接读取。它面向的是“中转站出图”场景,而不是直连官方 Ark API 的调用方式。

工作方式

技能把图像生成封装成可调用脚本。配置 ARK_BASE_URL、ARK_API_KEY、模型和保存目录后,gen.py 可以通过命令行或函数调用发起请求,并把结果输出为单个 JSON 对象,方便 json.loads 解析。核心能力包括:

  • 文生图:传入 prompt 和 size。对于默认 Seedream 模型,建议使用 2K 或更高,避免低于上游最小像素限制。
  • 图生图:支持公网 URL 和本地文件路径。脚本会把本地图片转成 base64 后再提交,也可以多张混搭。
  • 连续多图:通过 n 生成一组相关图片,返回多个本地路径。
  • 多图融合:把多张参考图输入模型,用于生成融合后的单图或一组图。

配置与边界

调用前需要先确认 api_key 是否存在;如果缺失,应让用户提供或进入初始化流程。输出默认会把图片下载到本地目录,同时保留远程 URL;如果 download 关闭,则只返回 URL。注意不同中转站可能改变模型名,也可能对 size 有不同限制。生成图 URL 通常会在约 24 小时后失效,因此持久化场景应依赖本地文件。若任务是读取、分析已有图片,或生成视频、语音,则不应使用这个技能。

使用场景

  • 给技术博客按章节提示生成 2K 封面图,并让脚本把 PNG 落到本地 assets 目录供编辑器引用。
  • 在 WorkBuddy 里说"画一只卡通橘猫",让 agent 调 generate_image 拿本地路径直接插进 PPT。
  • 拿一张产品草图加三张风格参考图做多图融合,一次产出 4 张电商主视觉变体。
  • 用 n=8 让 Seedream 出一组连续分镜,下载后按返回数组顺序拼进分镜表。

适合人员

  • 每周要给技术博客和 PPT 出插图的独立开发者,希望一句提示就能拿到可直接引用的本地图。
  • 给 WorkBuddy / OpenClaw 类 agent 写图像工具的工程师,需要能 json.loads 的统一调用入口。
  • 拿一张草图做多风格变体的电商设计师,要同时吃本地图和公网 URL 的参考。
  • 做分镜和 storyboards 的视觉策划,要一次拉一组相关图并落盘到固定目录。