> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# ComfyUI의 MiniMax Music 3: AI 음악 생성

> ComfyUI에서 MiniMax Music 3를 사용하여 구조화된 음악 캡션과 가사로 최대 5분 길이의 완전한 노래를 생성하는 방법을 알아보세요.

<img src="https://raw.githubusercontent.com/MiniMax-AI/MiniMax-Music3/main/figures/Music3.png" alt="MiniMax Music 3" />

[MiniMax Music 3](https://github.com/MiniMax-AI/MiniMax-Music3)는 최대 **5분** 길이의 완전한 노래를 생성하는 MiniMax의 음악 생성 모델입니다. 가사와 상세한 음악 설명을 조건으로 하여, 구조적으로 일관된 노래, 표현력 있는 보컬, 변화하는 편곡, 그리고 안정적인 장시간 오디오 품질을 생성합니다. 생성된 예시는 [공식 데모 페이지](https://minimax-ai.github.io/music3-demo/)에서 살펴볼 수 있습니다.

MiniMax Music 3는 계층적 오토리그레시브 아키텍처를 사용하며, 장기적인 음악 구조를 위한 8B 글로벌 LLM, 프레임 수준의 음향 디테일을 위한 0.6B 로컬 LLM, 그리고 Flow Matching과 Flow-VAE를 기반으로 하는 연속적인 숨김 상태 합성 시스템을 포함합니다. 32kHz, 16비트 스테레오 오디오를 출력합니다. 모델 가중치는 [MiniMax-Music3 커뮤니티 라이선스](https://huggingface.co/MiniMaxAI/MiniMax-Music3/blob/main/LICENSE)에 따라 제공됩니다.

ComfyUI는 공식 예제 워크플로인 **MiniMax Music 3 Text to Music**을 통해 MiniMax Music 3를 기본 지원합니다.

<Tip>
  <Tabs>
    <Tab title="로컬 사용자">
      ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.

      * [ComfyUI 다운로드](https://www.comfy.org/download)
      * [업데이트 가이드](/ko/installation/update_comfyui)

      이 가이드의 워크플로는 [워크플로 템플릿](/ko/interface/features/template)에서 확인할 수 있습니다.
      템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.

      워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:

      1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
      2. 일부 노드가 시작 시 가져오기에 실패함
    </Tab>

    <Tab title="클라우드 사용자">
      * [클라우드](https://cloud.comfy.org)는 ComfyUI 안정판 출시 후 업데이트됩니다.

      따라서 이 문서에서 핵심 노드가 누락된 것을 발견했다면, 그 이유는 새로운 핵심 노드가 아직 최신 안정판에 공개되지 않았기 때문일 수 있습니다. 다음 안정판 출시를 기다려 주세요.
    </Tab>
  </Tabs>
</Tip>

## 주요 기능

* **완전한 곡 생성**: 인트로, 벌스, 프리코러스, 코러스, 브릿지, 간주, 아웃트로를 포함하여 최대 5분 길이의 전체 트랙을 생성합니다
* **두 가지 입력 제어**: 구조화된 **Caption**은 음악 스타일, 분위기, 보컬, 편곡을 정의하고, 섹션 태그(`[Intro]`, `[Verse]`, `[Chorus]`, `[Bridge]`, `[Instrumental]`, `[Outro]`)가 포함된 **Lyrics**는 노래 구조를 제어합니다
* **장기적 일관성**: 긴 시퀀스에서 음악적 테마, 리듬, 보컬 정체성, 편곡 진행을 유지합니다
* **표현력 있는 보컬**: 멜로디, 발음, 레이어드 하모니를 제어할 수 있는 자연스러운 보컬 합성
* **오픈 웨이트**: 모든 파라미터를 완전히 제어할 수 있는 ComfyUI 로컬 실행

## 시작하기

MiniMax Music 3는 ComfyUI에서 오픈 가중치로 지원됩니다. 시작하려면:

1. ComfyUI를 최신 버전으로 업데이트
2. **템플릿 라이브러리** > **오디오**로 이동하여 **MiniMax Music 3** 워크플로 선택
3. 팝업 안내에 따라 모델을 다운로드하고 워크플로 실행

ComfyUI에서 바로 사용할 수 있는 모델 파일(리패키징된 diffusion 모델, 텍스트 인코더, VAE)은 Hugging Face의 [Comfy-Org/MiniMax-Music-3](https://huggingface.co/Comfy-Org/MiniMax-Music-3) 저장소에 호스팅되어 있습니다. 원본 모델 가중치는 [MiniMaxAI/MiniMax-Music3](https://huggingface.co/MiniMaxAI/MiniMax-Music3) 저장소에서 확인할 수 있습니다.

## MiniMax Music 3 텍스트 기반 음악 생성 워크플로우

구조화된 음악 캡션과 가사로 완성된 곡을 생성합니다.

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/thumbnail/audio_minimax_music_3.png" alt="MiniMax Music 3 텍스트 기반 음악 생성 워크플로우 미리보기" />

<CardGroup cols={2}>
  <Card title="워크플로 다운로드" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_minimax_music_3.json">
    JSON 다운로드 또는 템플릿 라이브러리에서 "MiniMax Music 3" 검색
  </Card>
</CardGroup>

이 워크플로우는 두 개의 텍스트 입력을 받아 완성된 곡을 출력합니다. 텍스트 인코더가 캡션과 가사에서 음향 컨디셔닝 시퀀스를 생성하고, 확산 모델이 오디오 잠재 표현을 합성하며, 오디오 VAE가 이를 32kHz 스테레오 트랙으로 디코딩하여 MP3로 저장합니다.

**워크플로우 제어 매개변수**:

* **Caption(캡션)** : 음악 설명. **Global Metadata(전역 메타데이터)**(장르, BPM, 조성, 음계, 감정 전개, 청취 시나리오, 프로덕션 프로필), **Vocal Details(보컬 세부사항)**(보컬 성별, 음색, 연주 스타일, 하모니, 보컬 효과), **Arrangement(편곡)**(주요 및 보조 악기, 그루브, 베이스, 퍼커션, 질감, 공간 효과)의 세 섹션으로 작성합니다. 구체적일수록 결과가 원하는 대로 나옵니다
* **Lyrics(가사)** : 노래할 가사. `[Intro]`, `[Verse]`, `[Chorus]`, `[Bridge]`, `[Instrumental]`, `[Outro]` 등의 섹션 태그를 사용할 수 있습니다. 태그가 구조 지시이며, 가사 텍스트 자체는 분위기를 전달합니다
* **max\_duration** : 목표 곡 길이(초)(템플릿 기본값은 60초. 모델은 약 300초 / 5분까지 지원). 곡이 길수록 시간과 VRAM을 더 많이 사용합니다
* **seed** : 생성용 랜덤 시드. 고정하면 같은 곡을 재현할 수 있고, 변경하면 다른 결과를 얻습니다
* **tiled\_decode** : 오디오 VAE를 겹치는 타일로 디코딩하여 VRAM 사용량을 크게 줄입니다. 낮은 VRAM GPU에서 긴 곡을 생성할 때 유용합니다. 속도는 약간 느려지고 타일 경계에 이음새가 생길 위험이 약간 있습니다. 높은 VRAM GPU에서는 끄고 최고 품질을 얻는 것이 좋습니다

### 모델 다운로드

<CardGroup cols={2}>
  <Card title="확산 모델(FP16)" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/diffusion_models/minimax_music3_dit_fp16.safetensors">
    minimax\_music3\_dit\_fp16.safetensors → ComfyUI/models/diffusion\_models/
  </Card>

  <Card title="확산 모델(INT8)" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/diffusion_models/minimax_music3_dit_int8_convrot.safetensors">
    minimax\_music3\_dit\_int8\_convrot.safetensors → ComfyUI/models/diffusion\_models/(낮은 VRAM용)
  </Card>

  <Card title="텍스트 인코더(INT8)" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/text_encoders/minimax_music3_text_encoder_pruned_int8_convrot.safetensors">
    minimax\_music3\_text\_encoder\_pruned\_int8\_convrot.safetensors → ComfyUI/models/text\_encoders/
  </Card>

  <Card title="VAE" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-Music-3/resolve/main/vae/minimax_music3_dav.safetensors">
    minimax\_music3\_dav.safetensors → ComfyUI/models/vae/
  </Card>
</CardGroup>

파일을 다음 디렉터리에 배치합니다:

```
📂 ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   ├── minimax_music3_dit_fp16.safetensors
│   │   └── minimax_music3_dit_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── minimax_music3_text_encoder_pruned_int8_convrot.safetensors
│   └── 📂 vae/
│       └── minimax_music3_dav.safetensors
```

### 프롬프트 팁

1. **캡션을 세 섹션으로 구성** : Global Metadata, Vocal Details, Arrangement. 모델은 전체적인 스타일뿐만 아니라 시간에 따라 전개되는 곡의 음악적 흐름도 따릅니다
2. **가사에 섹션 태그 사용** : `[Intro]`, `[Verse]`, `[Pre-Chorus]`, `[Chorus]`, `[Post-Chorus]`, `[Bridge]`, `[Instrumental]`, `[Solo]`, `[Outro]` 태그로 모델에 명확한 구조 제어를 제공합니다
3. **태그만 구조 지시로 사용** : 태그는 실행 가능한 지시입니다. 가사 텍스트 자체는 구조가 아니라 분위기를 전달합니다
4. **길이와 리소스 균형** : 곡이 길수록 시간과 VRAM을 더 사용합니다. 낮은 VRAM GPU에서 긴 곡을 생성할 때는 INT8 확산 모델과 타일 디코딩을 사용하세요

#### 프롬프트 작성 가이드

[공식 데모 페이지](https://minimax-ai.github.io/music3-demo/)에는 11개 장르(팝, 록, R\&B, 힙합, 댄스 팝, 컨트리, 소울, 펑크, 블루스, 보사노바, 어반)에 걸친 26개의 예시 트랙이 있으며, 각 트랙에는 Global Metadata / Vocal Details / Arrangement 형식으로 작성된 완전한 구조화 캡션이 포함되어 있습니다. 나만의 캡션을 작성할 때 참고하세요.

MiniMax는 공식 [음악 캡션 리라이터 스킬](https://github.com/MiniMax-AI/MiniMax-Music3)도 제공합니다. 간단한 음악 설명과 선택적인 태그가 붙은 가사를 상세한 Music 3.0 구조화 캡션으로 변환합니다. 이 스킬은 전역 메타데이터, 보컬 세부사항, 편곡 설명이 포함된 일관된 섹션별 구성을 만들며, 명시적인 음악적 제약을 보존하면서 가사 텍스트는 가사 입력에 남겨둡니다. 설치 방법:

```bash theme={null}
npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter
```

## 출력

생성된 노래는 `ComfyUI/output/audio/audio_minimax_music3.mp3` 또는 SaveAudioAdvanced 노드에서 설정된 파일 이름으로 저장됩니다.
