虚拟歌手 MV 制作
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a018d531/virtual-singer-mv 到你的 AI 助手。
技能介绍
要解决的问题
传统虚拟歌手 MV 需要音频分析、分镜、角色图、动画、字幕、合成多个环节,人工对齐歌词时间和节拍、保持角色一致性、合成最终视频成本较高。该技能面向已有音乐音频、歌词文本、视频脚本/分镜、虚拟歌手三视图参考图的制作场景,把流程拆成可确认的阶段,减少多工具串接和人工对齐成本。
如何工作
技能围绕六步流水线:先用 openai-whisper-api 转写音频,并运行 scripts/analyze_audio.py 提取 BPM、节拍时间戳和总时长,输出 lyrics_timeline.json 与 scene_timeline.json;再用 VideoGen 根据文本或概念图生成每个场景片段,必要时用 media-downloader 补充素材。角色部分通过 ImageGen 和三视图生成多角度、多表情图像,并用 nano-banana-pro 精修放大。动画可选 VideoGen 动态视频、video-fx 风格模板或图生 3D 模型三种模式。最后用 remotion-video-toolkit 按时间轴合成场景、角色动画、原始音频和歌词字幕,失败时可回退到 FFmpeg 拼接。
适用边界
它适合 16:9 或 9:16 的场景化 MV,不是通用音乐生成或纯歌词创作工具。若音频以器乐为主,Whisper 可能无法产生有效歌词,需要依赖用户提供的歌词文本;若 VideoGen、3D 或渲染失败,流程会降级为静态图、模板动画或 FFmpeg 组装。角色一致性依赖相同的关键视觉描述前缀,默认输出 1080P、30 FPS。
使用场景
- 有完整音乐、歌词、分镜和三视图,需要生成带角色动画与字幕的 1080P MV。
- 把器乐为主的音频和用户歌词对齐到节拍,输出歌词时间轴并合成字幕。
- 根据视频脚本生成舞台、城市夜景等场景片段,并补充 B-roll 备用素材。
- 从虚拟歌手三视图生成多表情角色图,并用模板动画或 3D 旋转镜头合成。
适合人员
- 独立音乐人:已有歌曲、歌词、分镜和三视图,想产出可发布的虚拟歌手 MV。
- 动画短片制作者:需要把角色三视图转成多表情素材、模板动画和合成时间轴。
- AIGC 视频创作者:希望用音频分析、场景生成和 Remotion 合成 1080P MV。
- 虚拟偶像运营:需要保持角色视觉一致,并生成带歌词字幕的舞台表演视频。