MiniMax Music 3는 최대 5분 길이의 완전한 노래를 생성하는 MiniMax의 음악 생성 모델입니다. 가사와 상세한 음악 설명을 조건으로 하여, 구조적으로 일관된 노래, 표현력 있는 보컬, 변화하는 편곡, 그리고 안정적인 장시간 오디오 품질을 생성합니다. 생성된 예시는 공식 데모 페이지에서 살펴볼 수 있습니다.
MiniMax Music 3는 계층적 오토리그레시브 아키텍처를 사용하며, 장기적인 음악 구조를 위한 8B 글로벌 LLM, 프레임 수준의 음향 디테일을 위한 0.6B 로컬 LLM, 그리고 Flow Matching과 Flow-VAE를 기반으로 하는 연속적인 숨김 상태 합성 시스템을 포함합니다. 32kHz, 16비트 스테레오 오디오를 출력합니다. 모델 가중치는 MiniMax-Music3 커뮤니티 라이선스에 따라 제공됩니다.
ComfyUI는 공식 예제 워크플로인 MiniMax Music 3 Text to Music을 통해 MiniMax Music 3를 기본 지원합니다.
주요 기능
- 완전한 곡 생성: 인트로, 벌스, 프리코러스, 코러스, 브릿지, 간주, 아웃트로를 포함하여 최대 5분 길이의 전체 트랙을 생성합니다
- 두 가지 입력 제어: 구조화된 Caption은 음악 스타일, 분위기, 보컬, 편곡을 정의하고, 섹션 태그(
[Intro],[Verse],[Chorus],[Bridge],[Instrumental],[Outro])가 포함된 Lyrics는 노래 구조를 제어합니다 - 장기적 일관성: 긴 시퀀스에서 음악적 테마, 리듬, 보컬 정체성, 편곡 진행을 유지합니다
- 표현력 있는 보컬: 멜로디, 발음, 레이어드 하모니를 제어할 수 있는 자연스러운 보컬 합성
- 오픈 웨이트: 모든 파라미터를 완전히 제어할 수 있는 ComfyUI 로컬 실행
시작하기
MiniMax Music 3는 ComfyUI에서 오픈 가중치로 지원됩니다. 시작하려면:- ComfyUI를 최신 버전으로 업데이트
- 템플릿 라이브러리 > 오디오로 이동하여 MiniMax Music 3 워크플로 선택
- 팝업 안내에 따라 모델을 다운로드하고 워크플로 실행
MiniMax Music 3 텍스트 기반 음악 생성 워크플로우
구조화된 음악 캡션과 가사로 완성된 곡을 생성합니다.워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “MiniMax Music 3” 검색
- Caption(캡션) : 음악 설명. Global Metadata(전역 메타데이터)(장르, BPM, 조성, 음계, 감정 전개, 청취 시나리오, 프로덕션 프로필), Vocal Details(보컬 세부사항)(보컬 성별, 음색, 연주 스타일, 하모니, 보컬 효과), Arrangement(편곡)(주요 및 보조 악기, 그루브, 베이스, 퍼커션, 질감, 공간 효과)의 세 섹션으로 작성합니다. 구체적일수록 결과가 원하는 대로 나옵니다
- Lyrics(가사) : 노래할 가사.
[Intro],[Verse],[Chorus],[Bridge],[Instrumental],[Outro]등의 섹션 태그를 사용할 수 있습니다. 태그가 구조 지시이며, 가사 텍스트 자체는 분위기를 전달합니다 - max_duration : 목표 곡 길이(초)(템플릿 기본값은 60초. 모델은 약 300초 / 5분까지 지원). 곡이 길수록 시간과 VRAM을 더 많이 사용합니다
- seed : 생성용 랜덤 시드. 고정하면 같은 곡을 재현할 수 있고, 변경하면 다른 결과를 얻습니다
- tiled_decode : 오디오 VAE를 겹치는 타일로 디코딩하여 VRAM 사용량을 크게 줄입니다. 낮은 VRAM GPU에서 긴 곡을 생성할 때 유용합니다. 속도는 약간 느려지고 타일 경계에 이음새가 생길 위험이 약간 있습니다. 높은 VRAM GPU에서는 끄고 최고 품질을 얻는 것이 좋습니다
모델 다운로드
확산 모델(FP16)
minimax_music3_dit_fp16.safetensors → ComfyUI/models/diffusion_models/
확산 모델(INT8)
minimax_music3_dit_int8_convrot.safetensors → ComfyUI/models/diffusion_models/(낮은 VRAM용)
텍스트 인코더(INT8)
minimax_music3_text_encoder_pruned_int8_convrot.safetensors → ComfyUI/models/text_encoders/
VAE
minimax_music3_dav.safetensors → ComfyUI/models/vae/
프롬프트 팁
- 캡션을 세 섹션으로 구성 : Global Metadata, Vocal Details, Arrangement. 모델은 전체적인 스타일뿐만 아니라 시간에 따라 전개되는 곡의 음악적 흐름도 따릅니다
- 가사에 섹션 태그 사용 :
[Intro],[Verse],[Pre-Chorus],[Chorus],[Post-Chorus],[Bridge],[Instrumental],[Solo],[Outro]태그로 모델에 명확한 구조 제어를 제공합니다 - 태그만 구조 지시로 사용 : 태그는 실행 가능한 지시입니다. 가사 텍스트 자체는 구조가 아니라 분위기를 전달합니다
- 길이와 리소스 균형 : 곡이 길수록 시간과 VRAM을 더 사용합니다. 낮은 VRAM GPU에서 긴 곡을 생성할 때는 INT8 확산 모델과 타일 디코딩을 사용하세요
프롬프트 작성 가이드
공식 데모 페이지에는 11개 장르(팝, 록, R&B, 힙합, 댄스 팝, 컨트리, 소울, 펑크, 블루스, 보사노바, 어반)에 걸친 26개의 예시 트랙이 있으며, 각 트랙에는 Global Metadata / Vocal Details / Arrangement 형식으로 작성된 완전한 구조화 캡션이 포함되어 있습니다. 나만의 캡션을 작성할 때 참고하세요. MiniMax는 공식 음악 캡션 리라이터 스킬도 제공합니다. 간단한 음악 설명과 선택적인 태그가 붙은 가사를 상세한 Music 3.0 구조화 캡션으로 변환합니다. 이 스킬은 전역 메타데이터, 보컬 세부사항, 편곡 설명이 포함된 일관된 섹션별 구성을 만들며, 명시적인 음악적 제약을 보존하면서 가사 텍스트는 가사 입력에 남겨둡니다. 설치 방법:출력
생성된 노래는ComfyUI/output/audio/audio_minimax_music3.mp3 또는 SaveAudioAdvanced 노드에서 설정된 파일 이름으로 저장됩니다.