Vidu 多模态生成工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @vidu/vidu-generation-2。
技能介绍
要解决的问题
调用 Vidu API 时,视频、图片和音频接口分散,模型参数、时长分辨率、音色选择、域名切换和异步轮询都需要手工处理。开发者若直接在聊天里描述需求,容易反复确认该用 text-to-video、image-to-video 还是 TTS,也容易忽略 VIDU_API_KEY、生成 URL 时效与任务状态。
技能如何工作
该技能把自然语言需求映射到 Vidu 的生成类型:纯文字触发文生视频或文生图;加入首帧图片转图生视频;多张参考图走参考生视频;首尾两张图走首尾帧视频;出现配音、朗读、复刻音色等则进入音频链路。
- 模型选择:根据场景推荐
viduq3-pro、viduq3-turbo、q3-fast等模型,并处理时长、分辨率与特殊比例。 - 音频合成:支持
speed、volume、pitch、emotion参数,并依据内容场景推荐中英文音色。 - 任务执行:调用前检查
VIDU_API_KEY,按用户语言选择api.vidu.cn或api.vidu.com,异步任务轮询状态,并返回可用的creations[0].url。
适用边界与注意点
该技能依赖 Vidu 开放平台的 API Key,不处理 Key 申请、计费或素材版权。生成 URL 通常 24 小时内有效,复刻音色 7 天内需在 TTS 中调用才会保留。长文本 TTS、图片大小、模型能力差异和任务失败都需要结合 API 错误信息判断。
使用场景
- 制作短视频:将一段文案和首帧图片生成 5 秒带音频的视频,用于社媒发布。
- 多主体广告:上传多张角色参考图,生成 3-10 秒多人场景视频并检查切镜。
- 配音:把教程长文本合成为中文播报男声 TTS,并调整语速和停顿。
- 图片制作:用参考图生成 1K/4K 海报,或基于 Vidu 模型做局部重绘。
适合人员
- 需要把产品脚本快速转成社媒短视频的运营
- 要把教程文案配成稳定中文播报声的剪辑师
- 需要调用 Vidu API 集成多模态生成接口的工程师
- 要做角色参考图和多人视频草稿的视觉设计