MiniMax Music 3 是 MiniMax 推出的音乐生成模型,可创建长达五分钟的完整歌曲。以歌词和详细的音乐描述为条件,它能够生成结构连贯的歌曲,具有富有表现力的人声、不断演变的编曲和稳定的长音频质量。您可以在官方演示页面上浏览已生成的示例。
MiniMax Music 3 采用分层自回归架构,包含一个用于长程音乐结构的 8B 全局 LLM,一个用于帧级声学细节的 0.6B 局部 LLM,以及一个基于 Flow Matching 和 Flow-VAE 的连续隐藏状态合成系统。它输出 32 kHz、16 位立体声音频。模型权重可根据 MiniMax-Music3 社区许可证 获取。
ComfyUI 原生支持 MiniMax Music 3,并提供了官方示例工作流:MiniMax Music 3 Text to Music。
主要特性
- 完整歌曲:生成最长 5 分钟的完整曲目,包含前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏
- 双输入控制:结构化的 Caption 定义音乐风格、情绪、人声和编曲,而带章节标签(
[Intro]、[Verse]、[Chorus]、[Bridge]、[Instrumental]、[Outro])的 Lyrics 控制歌曲结构 - 长程一致性:在长序列中保持音乐主题、节奏、人声特征和编曲推进
- 富有表现力的人声:自然的人声合成,可控制旋律、发音和分层和声
- 开放权重:在 ComfyUI 中本地运行,可完全控制每个参数
入门
ComfyUI 现已支持开放权重的 MiniMax Music 3。要开始使用:- 将 ComfyUI 更新到最新版本
- 前往 模板库 > 音频 > 选择 MiniMax Music 3 工作流
- 按照弹窗提示下载模型并运行工作流
MiniMax Music 3 文生音乐工作流
根据结构化的音乐描述和歌词生成一首完整的歌曲。下载工作流
下载 JSON,或在模板库中搜索 “MiniMax Music 3”
- Caption(描述):音乐描述。建议按三个部分编写:Global Metadata(全局元数据)(流派、BPM、调性、音阶、情绪推进、聆听场景、制作风格)、Vocal Details(人声细节)(人声性别、音色、演唱风格、和声、人声效果)、Arrangement(编曲)(主要和次要乐器、律动、低音、打击乐、织体、空间效果)。描述越具体,结果越接近预期
- Lyrics(歌词):要演唱的歌词,可使用
[Intro]、[Verse]、[Chorus]、[Bridge]、[Instrumental]、[Outro]等段落标签。标签是结构指令;歌词文本本身传达情绪 - max_duration:目标歌曲时长(秒)(模板默认 60 秒;模型最多支持约 300 秒 / 5 分钟)。歌曲越长,耗时和显存占用越多
- seed:生成用的随机种子。固定种子可复现同一首歌曲;更改种子可获得不同结果
- tiled_decode:以重叠分块方式解码音频 VAE,大幅降低显存占用,适合在低显存 GPU 上生成长歌曲。速度略慢,分块边界处有小概率出现接缝;高显存 GPU 上建议关闭以获得最佳质量
模型下载
扩散模型(FP16)
minimax_music3_dit_fp16.safetensors → ComfyUI/models/diffusion_models/
扩散模型(INT8)
minimax_music3_dit_int8_convrot.safetensors → ComfyUI/models/diffusion_models/(适合低显存)
文本编码器(INT8)
minimax_music3_text_encoder_pruned_int8_convrot.safetensors → ComfyUI/models/text_encoders/
VAE
minimax_music3_dav.safetensors → ComfyUI/models/vae/
提示词技巧
- 按三个部分编写描述:Global Metadata、Vocal Details、Arrangement。模型不仅遵循整体风格,还会跟随歌曲随时间推进的音乐发展
- 在歌词中使用段落标签:
[Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Post-Chorus]、[Bridge]、[Instrumental]、[Solo]、[Outro]为模型提供明确的结构控制 - 标签是唯一的结构指令:标签是可执行的;歌词文本本身只传达情绪,不传达结构
- 平衡时长与资源:歌曲越长,耗时和显存占用越多。在低显存 GPU 上生成长歌曲时,可使用 INT8 扩散模型并开启分块解码
提示词编写指南
官方演示页面展示了 11 种流派(流行、摇滚、R&B、嘻哈、舞蹈流行、乡村、灵魂、放克、布鲁斯、波萨诺瓦、都市)的 26 首示例曲目,每首都附有按 Global Metadata / Vocal Details / Arrangement 格式编写的完整结构化描述,可作为编写自己描述的参考。 MiniMax 还提供了官方音乐描述重写技能,可将简短的音乐描述和可选的分段歌词扩展为详细的 Music 3.0 结构化描述。该技能会构建连贯的分段编曲,包含全局元数据、人声细节和编曲描述,在保留显式音乐约束的同时将歌词文本保留在歌词输入中。安装方式:输出
已生成的歌曲会保存到ComfyUI/output/audio/audio_minimax_music3.mp3(或 SaveAudioAdvanced 节点中设置的文件名)。