> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# ComfyUI 中的 MiniMax Music 3：AI 音乐生成

> 了解如何在 ComfyUI 中使用 MiniMax Music 3，根据结构化的音乐描述和歌词生成最长 5 分钟的完整歌曲。

<img src="https://raw.githubusercontent.com/MiniMax-AI/MiniMax-Music3/main/figures/Music3.png" alt="MiniMax Music 3" />

[MiniMax Music 3](https://github.com/MiniMax-AI/MiniMax-Music3) 是 MiniMax 推出的音乐生成模型，可创建长达**五分钟**的完整歌曲。以歌词和详细的音乐描述为条件，它能够生成结构连贯的歌曲，具有富有表现力的人声、不断演变的编曲和稳定的长音频质量。您可以在[官方演示页面](https://minimax-ai.github.io/music3-demo/)上浏览已生成的示例。

MiniMax Music 3 采用分层自回归架构，包含一个用于长程音乐结构的 8B 全局 LLM，一个用于帧级声学细节的 0.6B 局部 LLM，以及一个基于 Flow Matching 和 Flow-VAE 的连续隐藏状态合成系统。它输出 32 kHz、16 位立体声音频。模型权重可根据 [MiniMax-Music3 社区许可证](https://huggingface.co/MiniMaxAI/MiniMax-Music3/blob/main/LICENSE) 获取。

ComfyUI 原生支持 MiniMax Music 3，并提供了官方示例工作流：**MiniMax Music 3 Text to Music**。

<Tip>
  <Tabs>
    <Tab title="本地用户">
      请确保你的 ComfyUI 已经更新。

      * [ComfyUI 下载](https://www.comfy.org/download)
      * [ComfyUI 更新教程](/zh/installation/update_comfyui)

      本指南里的工作流可以在[工作流模板](/zh/interface/features/template)中找到。如果找不到，可能是 ComfyUI 没有更新。

      如果加载工作流时有节点缺失，可能原因有：

      1. 你用的不是最新版（每夜版）。
      2. 启动时有些节点导入失败。
    </Tab>

    <Tab title="云端用户">
      * [Cloud](https://cloud.comfy.org) 会在 ComfyUI 稳定版本发布后更新。

      所以，如果你发现本文档中有任何核心节点缺失，可能是因为新核心节点尚未在最新稳定版中发布。请等待下一个稳定版发布。
    </Tab>
  </Tabs>
</Tip>

## 主要特性

* **完整歌曲**：生成最长 5 分钟的完整曲目，包含前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏
* **双输入控制**：结构化的 **Caption** 定义音乐风格、情绪、人声和编曲，而带章节标签（`[Intro]`、`[Verse]`、`[Chorus]`、`[Bridge]`、`[Instrumental]`、`[Outro]`）的 **Lyrics** 控制歌曲结构
* **长程一致性**：在长序列中保持音乐主题、节奏、人声特征和编曲推进
* **富有表现力的人声**：自然的人声合成，可控制旋律、发音和分层和声
* **开放权重**：在 ComfyUI 中本地运行，可完全控制每个参数

## 入门

ComfyUI 现已支持开放权重的 MiniMax Music 3。要开始使用：

1. 将 ComfyUI 更新到最新版本
2. 前往 **模板库** > **音频** > 选择 **MiniMax Music 3** 工作流
3. 按照弹窗提示下载模型并运行工作流

ComfyUI 可直接使用的模型文件（重新打包的 diffusion 模型、文本编码器和 VAE）托管在 Hugging Face 的 [Comfy-Org/MiniMax-Music-3](https://huggingface.co/Comfy-Org/MiniMax-Music-3) 仓库中。原始模型权重可从 [MiniMaxAI/MiniMax-Music3](https://huggingface.co/MiniMaxAI/MiniMax-Music3) 仓库获取。

## MiniMax Music 3 文生音乐工作流

根据结构化的音乐描述和歌词生成一首完整的歌曲。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/thumbnail/audio_minimax_music_3.png" alt="MiniMax Music 3 文生音乐工作流预览" />

<CardGroup cols={2}>
  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_minimax_music_3.json">
    下载 JSON，或在模板库中搜索 “MiniMax Music 3”
  </Card>
</CardGroup>

该工作流接收两个文本输入并输出一首完整的歌曲。文本编码器根据描述和歌词生成声学条件序列，扩散模型合成音频潜空间，音频 VAE 将其解码为 32 kHz 立体声轨道并保存为 MP3。

**工作流控制参数**：

* **Caption（描述）**：音乐描述。建议按三个部分编写：**Global Metadata（全局元数据）**（流派、BPM、调性、音阶、情绪推进、聆听场景、制作风格）、**Vocal Details（人声细节）**（人声性别、音色、演唱风格、和声、人声效果）、**Arrangement（编曲）**（主要和次要乐器、律动、低音、打击乐、织体、空间效果）。描述越具体，结果越接近预期
* **Lyrics（歌词）**：要演唱的歌词，可使用 `[Intro]`、`[Verse]`、`[Chorus]`、`[Bridge]`、`[Instrumental]`、`[Outro]` 等段落标签。标签是结构指令；歌词文本本身传达情绪
* **max\_duration**：目标歌曲时长（秒）（模板默认 60 秒；模型最多支持约 300 秒 / 5 分钟）。歌曲越长，耗时和显存占用越多
* **seed**：生成用的随机种子。固定种子可复现同一首歌曲；更改种子可获得不同结果
* **tiled\_decode**：以重叠分块方式解码音频 VAE，大幅降低显存占用，适合在低显存 GPU 上生成长歌曲。速度略慢，分块边界处有小概率出现接缝；高显存 GPU 上建议关闭以获得最佳质量

### 模型下载

<CardGroup cols={2}>
  <Card title="扩散模型（FP16）" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/diffusion_models/minimax_music3_dit_fp16.safetensors">
    minimax\_music3\_dit\_fp16.safetensors → ComfyUI/models/diffusion\_models/
  </Card>

  <Card title="扩散模型（INT8）" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/diffusion_models/minimax_music3_dit_int8_convrot.safetensors">
    minimax\_music3\_dit\_int8\_convrot.safetensors → ComfyUI/models/diffusion\_models/（适合低显存）
  </Card>

  <Card title="文本编码器（INT8）" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/text_encoders/minimax_music3_text_encoder_pruned_int8_convrot.safetensors">
    minimax\_music3\_text\_encoder\_pruned\_int8\_convrot.safetensors → ComfyUI/models/text\_encoders/
  </Card>

  <Card title="VAE" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/vae/minimax_music3_dav.safetensors">
    minimax\_music3\_dav.safetensors → ComfyUI/models/vae/
  </Card>
</CardGroup>

将文件放到以下目录：

```
📂 ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   ├── minimax_music3_dit_fp16.safetensors
│   │   └── minimax_music3_dit_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── minimax_music3_text_encoder_pruned_int8_convrot.safetensors
│   └── 📂 vae/
│       └── minimax_music3_dav.safetensors
```

### 提示词技巧

1. **按三个部分编写描述**：Global Metadata、Vocal Details、Arrangement。模型不仅遵循整体风格，还会跟随歌曲随时间推进的音乐发展
2. **在歌词中使用段落标签**：`[Intro]`、`[Verse]`、`[Pre-Chorus]`、`[Chorus]`、`[Post-Chorus]`、`[Bridge]`、`[Instrumental]`、`[Solo]`、`[Outro]` 为模型提供明确的结构控制
3. **标签是唯一的结构指令**：标签是可执行的；歌词文本本身只传达情绪，不传达结构
4. **平衡时长与资源**：歌曲越长，耗时和显存占用越多。在低显存 GPU 上生成长歌曲时，可使用 INT8 扩散模型并开启分块解码

#### 提示词编写指南

[官方演示页面](https://minimax-ai.github.io/music3-demo/)展示了 11 种流派（流行、摇滚、R\&B、嘻哈、舞蹈流行、乡村、灵魂、放克、布鲁斯、波萨诺瓦、都市）的 26 首示例曲目，每首都附有按 Global Metadata / Vocal Details / Arrangement 格式编写的完整结构化描述，可作为编写自己描述的参考。

MiniMax 还提供了官方[音乐描述重写技能](https://github.com/MiniMax-AI/MiniMax-Music3)，可将简短的音乐描述和可选的分段歌词扩展为详细的 Music 3.0 结构化描述。该技能会构建连贯的分段编曲，包含全局元数据、人声细节和编曲描述，在保留显式音乐约束的同时将歌词文本保留在歌词输入中。安装方式：

```bash theme={null}
npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter
```

## 输出

已生成的歌曲会保存到 `ComfyUI/output/audio/audio_minimax_music3.mp3`（或 SaveAudioAdvanced 节点中设置的文件名）。
