주요 기능
- 완전한 곡 생성: 인트로, 벌스, 프리코러스, 코러스, 브릿지, 간주, 아웃트로를 포함하여 최대 5분 길이의 전체 트랙을 생성합니다
- 두 가지 입력 제어: 구조화된 Caption은 음악 스타일, 분위기, 보컬, 편곡을 정의하고, 섹션 태그(
[Intro],[Verse],[Chorus],[Bridge],[Instrumental],[Outro])가 포함된 Lyrics는 노래 구조를 제어합니다 - 장기적 일관성: 긴 시퀀스에서 음악적 테마, 리듬, 보컬 정체성, 편곡 진행을 유지합니다
- 표현력 있는 보컬: 멜로디, 발음, 레이어드 하모니를 제어할 수 있는 자연스러운 보컬 합성
- 오픈 웨이트: 모든 파라미터를 완전히 제어할 수 있는 ComfyUI 로컬 실행
시작하기
MiniMax Music 3는 ComfyUI에서 오픈 가중치로 지원됩니다. 시작하려면:- ComfyUI를 최신 버전으로 업데이트
- 템플릿 라이브러리 > 오디오로 이동하여 MiniMax Music 3 워크플로 선택
- 팝업 안내에 따라 모델을 다운로드하고 워크플로 실행
MiniMax Music 3 텍스트 기반 음악 생성 워크플로우
구조화된 음악 캡션과 가사로 완성된 곡을 생성합니다.Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “MiniMax Music 3” 검색
- Caption(캡션) : 음악 설명. Global Metadata(전역 메타데이터)(장르, BPM, 조성, 음계, 감정 전개, 청취 시나리오, 프로덕션 프로필), Vocal Details(보컬 세부사항)(보컬 성별, 음색, 연주 스타일, 하모니, 보컬 효과), Arrangement(편곡)(주요 및 보조 악기, 그루브, 베이스, 퍼커션, 질감, 공간 효과)의 세 섹션으로 작성합니다. 구체적일수록 결과가 원하는 대로 나옵니다
- Lyrics(가사) : 노래할 가사.
[Intro],[Verse],[Chorus],[Bridge],[Instrumental],[Outro]등의 섹션 태그를 사용할 수 있습니다. 태그가 구조 지시이며, 가사 텍스트 자체는 분위기를 전달합니다 - max_duration : 목표 곡 길이(초)(템플릿 기본값은 60초. 모델은 약 300초 / 5분까지 지원). 곡이 길수록 시간과 VRAM을 더 많이 사용합니다
- seed : 생성용 랜덤 시드. 고정하면 같은 곡을 재현할 수 있고, 변경하면 다른 결과를 얻습니다
- tiled_decode : 오디오 VAE를 겹치는 타일로 디코딩하여 VRAM 사용량을 크게 줄입니다. 낮은 VRAM GPU에서 긴 곡을 생성할 때 유용합니다. 속도는 약간 느려지고 타일 경계에 이음새가 생길 위험이 약간 있습니다. 높은 VRAM GPU에서는 끄고 최고 품질을 얻는 것이 좋습니다
모델 다운로드
확산 모델(FP16)
minimax_music3_dit_fp16.safetensors → ComfyUI/models/diffusion_models/
확산 모델(INT8)
minimax_music3_dit_int8_convrot.safetensors → ComfyUI/models/diffusion_models/(낮은 VRAM용)
텍스트 인코더(INT8)
minimax_music3_text_encoder_pruned_int8_convrot.safetensors → ComfyUI/models/text_encoders/
VAE
minimax_music3_dav.safetensors → ComfyUI/models/vae/
프롬프트 팁
- 캡션을 세 섹션으로 구성 : Global Metadata, Vocal Details, Arrangement. 모델은 전체적인 스타일뿐만 아니라 시간에 따라 전개되는 곡의 음악적 흐름도 따릅니다
- 가사에 섹션 태그 사용 :
[Intro],[Verse],[Pre-Chorus],[Chorus],[Post-Chorus],[Bridge],[Instrumental],[Solo],[Outro]태그로 모델에 명확한 구조 제어를 제공합니다 - 태그만 구조 지시로 사용 : 태그는 실행 가능한 지시입니다. 가사 텍스트 자체는 구조가 아니라 분위기를 전달합니다
- 길이와 리소스 균형 : 곡이 길수록 시간과 VRAM을 더 사용합니다. 낮은 VRAM GPU에서 긴 곡을 생성할 때는 INT8 확산 모델과 타일 디코딩을 사용하세요
프롬프트 작성 가이드
공식 데모 페이지에는 11개 장르(팝, 록, R&B, 힙합, 댄스 팝, 컨트리, 소울, 펑크, 블루스, 보사노바, 어반)에 걸친 26개의 예시 트랙이 있으며, 각 트랙에는 Global Metadata / Vocal Details / Arrangement 형식으로 작성된 완전한 구조화 캡션이 포함되어 있습니다. 나만의 캡션을 작성할 때 참고하세요. MiniMax는 공식 음악 캡션 리라이터 스킬도 제공합니다. 간단한 음악 설명과 선택적인 태그가 붙은 가사를 상세한 Music 3.0 구조화 캡션으로 변환합니다. 이 스킬은 전역 메타데이터, 보컬 세부사항, 편곡 설명이 포함된 일관된 섹션별 구성을 만들며, 명시적인 음악적 제약을 보존하면서 가사 텍스트는 가사 입력에 남겨둡니다. 설치 방법:출력
생성된 노래는ComfyUI/output/audio/audio_minimax_music3.mp3 또는 SaveAudioAdvanced 노드에서 설정된 파일 이름으로 저장됩니다.