Agent Skills
返回列表
Vidu 多模态生成工具

Vidu 多模态生成工具

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @vidu/vidu-generation-2。

技能介绍

要解决的问题

调用 Vidu API 时,视频、图片和音频接口分散,模型参数、时长分辨率、音色选择、域名切换和异步轮询都需要手工处理。开发者若直接在聊天里描述需求,容易反复确认该用 text-to-video、image-to-video 还是 TTS,也容易忽略 VIDU_API_KEY、生成 URL 时效与任务状态。

技能如何工作

该技能把自然语言需求映射到 Vidu 的生成类型:纯文字触发文生视频或文生图;加入首帧图片转图生视频;多张参考图走参考生视频;首尾两张图走首尾帧视频;出现配音、朗读、复刻音色等则进入音频链路。

  • 模型选择:根据场景推荐 viduq3-pro、viduq3-turbo、q3-fast 等模型,并处理时长、分辨率与特殊比例。
  • 音频合成:支持 speed、volume、pitch、emotion 参数,并依据内容场景推荐中英文音色。
  • 任务执行:调用前检查 VIDU_API_KEY,按用户语言选择 api.vidu.cn 或 api.vidu.com,异步任务轮询状态,并返回可用的 creations[0].url。

适用边界与注意点

该技能依赖 Vidu 开放平台的 API Key,不处理 Key 申请、计费或素材版权。生成 URL 通常 24 小时内有效,复刻音色 7 天内需在 TTS 中调用才会保留。长文本 TTS、图片大小、模型能力差异和任务失败都需要结合 API 错误信息判断。

使用场景

  • 制作短视频:将一段文案和首帧图片生成 5 秒带音频的视频,用于社媒发布。
  • 多主体广告:上传多张角色参考图,生成 3-10 秒多人场景视频并检查切镜。
  • 配音:把教程长文本合成为中文播报男声 TTS,并调整语速和停顿。
  • 图片制作:用参考图生成 1K/4K 海报,或基于 Vidu 模型做局部重绘。

适合人员

  • 需要把产品脚本快速转成社媒短视频的运营
  • 要把教程文案配成稳定中文播报声的剪辑师
  • 需要调用 Vidu API 集成多模态生成接口的工程师
  • 要做角色参考图和多人视频草稿的视觉设计