混元智能生图
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/hy-image-generation。
技能介绍
在利用大语言模型(LLM)驱动的 Agent 自动化工作流中,将自然语言转换为高质量图像是一项常见需求。手动编写生图 API 的调用代码、处理异步任务轮询以及参数校验会消耗大量开发时间,而直接依赖 Agent 自身的“想象力”又无法保证输出结果的可控性与可复现性。HY Image Generation 技能将腾讯混元大模型的生图能力封装为一组脚本,旨在让 Agent 能够可靠地、自主地完成从文本到图像的完整流程。
核心能力
该技能提供了三个核心的 Python 脚本,各司其职:
main.py(推荐): 这是执行生图任务的首选入口。它封装了任务提交与结果轮询的完整逻辑,Agent 只需调用这一个脚本并传递参数,即可等待最终的图像 URL 输出,实现了真正的“零干预”自动化。submit_job.py: 适用于需要解耦提交与查询的场景。它仅负责提交生图请求并立即返回一个唯一的JobId,便于集成到更复杂的任务队列中。query_job.py: 用于追踪和获取已提交任务的结果。通过传入JobId,可以手动查询任务状态、获取生成的图像,或在失败时查看错误信息。
关键步骤与参数
一个典型的生成过程涉及以下关键点:
- 任务提交与自动化:默认情况下,Agent 应直接调用
main.py。脚本内部会处理依赖安装、凭证检测、API 调用和结果等待,最终输出包含图像 URL 的 JSON。例如:python main.py --prompt "一只机械猫在赛博朋克城市中" --resolution 1024:768。 - 图像引导与控制:
垫图 (--images): 可以通过传入最多3张图片 URL 来引导生图的方向和风格。
分辨率 (--resolution): 自定义输出图像的宽高,必须在 [512, 2048] 范围内,且总像素面积不超过 1024×1024。例如,竖版海报常用 768:1024。
* Prompt 改写 (--revise): 默认开启,混元大模型会优化用户的原始提示词以获得更好效果,但这会额外增加约20秒的处理时间。
适用边界与注意点
- 输出有效期:生成的图像 URL 有效期为 1 小时,Agent 必须提醒用户及时保存,或自行将结果持久化。
- 环境依赖:首次运行需要有效的腾讯云 API 密钥(SecretId 和 SecretKey),并需确保网络可以访问腾讯云 API。
- 失败处理:若任务失败(如触发内容安全策略、参数错误),脚本会返回明确的错误码和信息,Agent 应据此向用户反馈,绝不能自行编造一个虚假的图像结果。
- 性能与成本:启用 Prompt 改写会增加耗时;生图服务通常有调用频率和费用,Agent 在执行前应具备相应的成本意识。
使用场景
- 根据一段详细的文字描述(如角色设定、场景氛围),生成具体的视觉化概念图,用于游戏或影视项目的前期设计讨论。
- 在社交媒体运营中,需要为一篇文章或产品发布快速生成多张不同尺寸(如方形、竖版、横幅)的配套插图。
- 设计师有初步的设计概念草图或参考图片,希望结合文字提示,用AI生成更精细、风格一致的多张视觉方案供筛选。
- 开发者需要在应用中集成图像生成API,处理用户提交的生图请求,并管理从提交到获取结果的完整异步流程。
适合人员
- 独立游戏开发者或概念设计师:需要根据剧本描述快速迭代角色、场景的视觉原型。
- 新媒体运营或内容创作者:需要为不同平台(微信公众号、小红书、抖音)的图文内容批量制作尺寸适配的原创配图。
- 产品经理或营销人员:需要将产品功能或营销文案的要点,快速转化为直观的界面示意图或宣传海报概念图。
- AI应用开发者:需要在自己的应用或服务中集成稳定可靠的文本生图能力,而不想从零搭建复杂的API调用和任务管理系统。