Agent Skills
返回列表
虚拟歌手 MV 制作

虚拟歌手 MV 制作

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a018d531/virtual-singer-mv 到你的 AI 助手。

技能介绍

要解决的问题

传统虚拟歌手 MV 需要音频分析、分镜、角色图、动画、字幕、合成多个环节,人工对齐歌词时间和节拍、保持角色一致性、合成最终视频成本较高。该技能面向已有音乐音频、歌词文本、视频脚本/分镜、虚拟歌手三视图参考图的制作场景,把流程拆成可确认的阶段,减少多工具串接和人工对齐成本。

如何工作

技能围绕六步流水线:先用 openai-whisper-api 转写音频,并运行 scripts/analyze_audio.py 提取 BPM、节拍时间戳和总时长,输出 lyrics_timeline.json 与 scene_timeline.json;再用 VideoGen 根据文本或概念图生成每个场景片段,必要时用 media-downloader 补充素材。角色部分通过 ImageGen 和三视图生成多角度、多表情图像,并用 nano-banana-pro 精修放大。动画可选 VideoGen 动态视频、video-fx 风格模板或图生 3D 模型三种模式。最后用 remotion-video-toolkit 按时间轴合成场景、角色动画、原始音频和歌词字幕,失败时可回退到 FFmpeg 拼接。

适用边界

它适合 16:9 或 9:16 的场景化 MV,不是通用音乐生成或纯歌词创作工具。若音频以器乐为主,Whisper 可能无法产生有效歌词,需要依赖用户提供的歌词文本;若 VideoGen、3D 或渲染失败,流程会降级为静态图、模板动画或 FFmpeg 组装。角色一致性依赖相同的关键视觉描述前缀,默认输出 1080P、30 FPS。

使用场景

  • 有完整音乐、歌词、分镜和三视图,需要生成带角色动画与字幕的 1080P MV。
  • 把器乐为主的音频和用户歌词对齐到节拍,输出歌词时间轴并合成字幕。
  • 根据视频脚本生成舞台、城市夜景等场景片段,并补充 B-roll 备用素材。
  • 从虚拟歌手三视图生成多表情角色图,并用模板动画或 3D 旋转镜头合成。

适合人员

  • 独立音乐人:已有歌曲、歌词、分镜和三视图,想产出可发布的虚拟歌手 MV。
  • 动画短片制作者:需要把角色三视图转成多表情素材、模板动画和合成时间轴。
  • AIGC 视频创作者:希望用音频分析、场景生成和 Remotion 合成 1080P MV。
  • 虚拟偶像运营:需要保持角色视觉一致,并生成带歌词字幕的舞台表演视频。