MiniMax 多媒体生成工具包
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6f64fcbc/minimax-multimedia-generate。
技能介绍
解决什么
当需要把文案变成 TTS、有声书、音乐 BGM、图像或短视频,并统一处理片段拼接、格式转换时,手动调用多个 API 与 ffmpeg 容易重复。该技能将 MiniMax 多模态能力整理为 bash 脚本,围绕 MINIMAX_API_KEY 和 MINIMAX_API_HOST 运行。
如何工作
- 语音:单段文本直接生成;多角色或长文本先写
segments.json,再执行多段生成,按旁白与角色分轨并做交叉淡入。 - 音乐:视频或播客背景音默认 instrumental;明确创作歌曲时再选择纯音乐或带词。
- 图像:默认 text-to-image;提供角色参考图时切到 image-to-image,并按头像、壁纸、海报等语境选择比例。
- 视频:支持文生视频、图生视频、主体参考与长视频串联;输出统一写入
minimax-output/。 - 媒体处理:用
ffmpeg做转码、拼接、裁剪和片段抽取。
适用边界
它只覆盖 MiniMax 支持的能力与用户配额。视频常见为 768P,且按 6 秒片段计数,生成前应先确认计划额度。脚本不依赖 Python,但需要 curl、jq、xxd、ffmpeg 与有效 API 配置。
使用场景
- 为播客脚本生成旁白与角色对白,并按 `segments.json` 分段配音后合成一条音频。
- 给产品宣传片制作 768P 6 秒文生视频或图生视频片段,并导出到指定目录。
- 依据参考人像图生成同一角色在不同场景的封面图,并按海报或手机壁纸选择比例。
- 用 FFmpeg 脚本把多段语音或视频做转码、拼接、裁剪和片段抽取。
适合人员
- 制作有声书或播客的编辑,需要把旁白和角色对话分轨并合成一条音频。
- 内容运营或视频创作者,需要快速生成背景纯音乐、封面图和短视频片段。
- 前端或自动化工程师,需要绕过 Python 依赖,用 bash、curl、ffmpeg 调用 MiniMax API。
- 产品演示者,需要用角色参考图保持同一人物形象并输出多比例图片。