豆包图片与视频生成
将以下提示词粘贴到你的 AI 对话框中:
请根据官方安装指南 https://skillhub.cn/install/skillhub.md,安装 @user_9aa92135/doubao-image-video 技能到你的 AI 助手中。
技能介绍
背景与问题
在基于豆包(Doubao)模型进行应用开发时,开发者常常需要集成其强大的文本生成图像、图像转换以及视频生成功能。直接调用底层 API 意味着需要自行处理复杂的请求结构、管理异步的视频生成任务、并在出现 InvalidEndpointOrModel.NotFound 等错误时进行排查。这要求开发者对 Volcengine Ark 的端点模型有深入了解,并编写额外的代码来封装这些通用操作。
核心能力与关键流程
该原生技能通过预封装的命令,直接简化了与豆包媒体生成 API 的交互。
1. 媒体内容生成
技能提供了清晰的子命令来处理不同场景:
- 图像生成:支持纯文本生成图像(
text-to-image)以及以一张或多张参考图作为输入的图像生成(image-to-image)。 - 视频生成:支持
text-to-video和image-to-video两种模式。它会自动为你的提示词(prompt)追加--dur(时长)、--fps(帧率)、--rs(分辨率)和--ratio(宽高比)等关键参数,如果它们尚未被显式指定。
2. 关键的输入规则
为了精确控制调用,技能优先遵循以下规则:
- 当你拥有已配置好的 Volcengine Ark 端点时,始终优先使用
--endpoint-id参数。只有在端点 ID 不可用时,才会回退到使用模型名称。 - 如果输入中包含图像 URL,技能会直接透传,不会擅自下载或重新托管,确保了流程的确定性。
3. 异步任务管理与故障排查
视频生成是一个异步过程。技能的设计周全地考虑了这一流程:
- 生成成功后,会返回一个
task_id。你可以使用query子命令和此 ID 来查询任务状态与结果。 wait子命令可以实现自动轮询,直至任务完成并可选地下载结果文件,极大地简化了异步等待的代码逻辑。- 遇到端点或模型报错时,技能内置的故障排除逻辑会提示首先验证你的 Volcengine Ark 端点授权状态,这是最常见的问题根源。
适用边界与注意点
请务必理解该技能的定位与边界:
- 它是一个为豆包模型优化的原生技能,并非通用的 MCP 服务。除非你明确需要 MCP 兼容性,否则无需启动上游 MCP 服务器。
- 其全部功能强依赖于 Volcengine Ark 平台及有效的端点授权。请确保你的调用环境已正确配置相关密钥或端点。
- 技能的视频生成功能遵循豆包模型的上游行为。对于超出技能预设参数范围的高级自定义需求,可能需要直接查阅 API 文档(
references/api-notes.md)进行处理。 - 它专注于媒体生成与任务查询,不涉及内容的后处理(如高级编辑)或非豆包模型的调度。
使用场景
- 作为产品设计师,需要根据产品文案快速生成多款概念视觉图用于内部评审,使用技能通过 `text-to-image` 命令直接生成。
- 作为插画师,需要将线稿草图转换为完整上色的数字插画,使用技能的 `image-to-image` 功能并提供参考图来细化作品风格。
- 作为市场运营,需要为一个新活动文案制作15秒的社交媒体宣传短视频,使用技能的 `text-to-video` 命令生成初版视频素材。
- 作为技术集成开发者,需要在自己的自动化工作流中嵌入豆包视频生成,并能监控和获取异步生成的任务结果,使用技能的 `query` 和 `wait` 子命令。
适合人员
- 需要频繁进行视觉素材创作但非专业动画师的产品经理或运营,快速将想法转化为图像和短视频。
- 负责将文本脚本转化为可视化培训材料或演示视频的教育内容开发者,需要高效生成视频初稿。
- 需要为社交媒体、广告批量生成多样化图像和短视频内容的营销团队成员,管理异步生成任务。
- 计划在自有平台或工具中集成豆包媒体生成能力的应用开发者,需要处理API交互、错误和任务状态。