Agent Skills
返回列表
MiniMax 多媒体生成工具包

MiniMax 多媒体生成工具包

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6f64fcbc/minimax-multimedia-generate。

技能介绍

解决什么

当需要把文案变成 TTS、有声书、音乐 BGM、图像或短视频,并统一处理片段拼接、格式转换时,手动调用多个 API 与 ffmpeg 容易重复。该技能将 MiniMax 多模态能力整理为 bash 脚本,围绕 MINIMAX_API_KEY 和 MINIMAX_API_HOST 运行。

如何工作

  • 语音:单段文本直接生成;多角色或长文本先写 segments.json,再执行多段生成,按旁白与角色分轨并做交叉淡入。
  • 音乐:视频或播客背景音默认 instrumental;明确创作歌曲时再选择纯音乐或带词。
  • 图像:默认 text-to-image;提供角色参考图时切到 image-to-image,并按头像、壁纸、海报等语境选择比例。
  • 视频:支持文生视频、图生视频、主体参考与长视频串联;输出统一写入 minimax-output/。
  • 媒体处理:用 ffmpeg 做转码、拼接、裁剪和片段抽取。

适用边界

它只覆盖 MiniMax 支持的能力与用户配额。视频常见为 768P,且按 6 秒片段计数,生成前应先确认计划额度。脚本不依赖 Python,但需要 curl、jq、xxd、ffmpeg 与有效 API 配置。

使用场景

  • 为播客脚本生成旁白与角色对白,并按 `segments.json` 分段配音后合成一条音频。
  • 给产品宣传片制作 768P 6 秒文生视频或图生视频片段,并导出到指定目录。
  • 依据参考人像图生成同一角色在不同场景的封面图,并按海报或手机壁纸选择比例。
  • 用 FFmpeg 脚本把多段语音或视频做转码、拼接、裁剪和片段抽取。

适合人员

  • 制作有声书或播客的编辑,需要把旁白和角色对话分轨并合成一条音频。
  • 内容运营或视频创作者,需要快速生成背景纯音乐、封面图和短视频片段。
  • 前端或自动化工程师,需要绕过 Python 依赖,用 bash、curl、ffmpeg 调用 MiniMax API。
  • 产品演示者,需要用角色参考图保持同一人物形象并输出多比例图片。