Skip to main content
MiniMax H3는 MiniMax의 범용 옴니모달 생성 모델로, 현재 오픈 가중치로 제공됩니다. 이 모델은 단일 컨텍스트에서 텍스트, 이미지, 비디오, 오디오를 함께 이해하며, 네이티브 스테레오 오디오로 비디오를 생성합니다. 음성, 사운드 효과, 음악이 이후에 덧붙여지는 대신 단일 포워드 패스에서 함께 모델링됩니다. 출력은 최대 2K 해상도, 24fps, 약 15초입니다. ComfyUI는 MiniMax H3를 네이티브로 지원합니다. 템플릿 라이브러리에는 현재 각각 하나의 생성 모드를 다루는 예제 워크플로 3개가 제공됩니다:
  • 텍스트 기반 비디오 생성 (T2V): 텍스트 프롬프트에서 비디오를 생성합니다
  • 이미지 기반 비디오 생성 (I2V): 입력 이미지에서 비디오를 생성하며, 선택적으로 첫 번째/마지막 프레임 제어 옵션을 지원합니다
  • 레퍼런스 기반 비디오 생성 (R2V): 레퍼런스 이미지, 비디오, 오디오에서 캐릭터, 스타일, 모션, 카메라 무브 또는 음성을 고정하여 비디오를 생성합니다
이 세 가지는 예제 템플릿이며 모델의 전체 기능을 나열한 것이 아닙니다. 네이티브 MiniMax H3 노드를 통해 더 많은 생성 모드를 사용할 수 있습니다: MiniMaxH3ImageToVideo 노드로 첫 번째/마지막 프레임 이미지-비디오 생성(fl2va), MiniMaxH3ReferenceToVideo 노드로 이미지, 비디오, 오디오 레퍼런스 기반 생성(ref2va)이 가능합니다. 이 노드들로 추가 워크플로를 직접 구축할 수도 있습니다.

주요 기능

  • 네이티브 스테레오 오디오: 대화, 사운드 효과, 음악이 비디오와 함께 생성되어 하나의 MP4로 동기화됩니다
  • 멀티모달 컨텍스트: 텍스트, 이미지, 비디오 및 오디오 참조를 하나의 생성에서 결합할 수 있습니다
  • 참조 기반 생성: 참조 자료에서 캐릭터의 정체성, 스타일, 모션, 카메라 이동 또는 음성을 고정합니다
  • 지시 따르기: 참조와 대상 샷 간의 관계를 자연 언어로 설명합니다
  • 정확한 텍스트 렌더링: 철자로 표기된 텍스트와 브랜드 요소가 깔끔하게 렌더링됩니다
  • 오픈 가중치: 모든 매개변수를 완전히 제어하면서 ComfyUI에서 로컬로 실행합니다

시작하기

MiniMax H3는 오픈 가중치로 ComfyUI에서 지원됩니다. 시작하려면:
  1. ComfyUI를 0.30.0 이상으로 업데이트합니다
  2. 템플릿 라이브러리 > 비디오로 이동하여 원하는 MiniMax H3 워크플로를 선택합니다
  3. 팝업 안내에 따라 모델을 다운로드하고 워크플로를 실행합니다
모델 파일은 Hugging Face의 Comfy-Org/MiniMax-H3 저장소에서 호스팅됩니다.

출력 해상도 설정

각 워크플로는 Resolution Selector(해상도 선택기) 노드를 사용하여 전체 출력 크기를 제어합니다. 이 노드는 세 가지 설정에서 widthheight를 계산하며, 출력은 MiniMax H3 노드의 widthheight 입력에 직접 연결됩니다:
  • 화면 비율: 16:9 (Widescreen), 9:16 (Portrait Widescreen), 1:1 (Square) 같은 프리셋을 선택합니다
  • 메가픽셀: 출력의 목표 총 픽셀 수. 값이 클수록 더 큰 프레임이 생성되고, 작을수록 더 빠르게 생성됩니다
  • 배수: 계산된 해상도는 이 값의 가장 가까운 배수로 반올림됩니다. H3의 해상도 그리드에 맞게 32로 유지합니다
템플릿은 빠른 미리보기 크기로 제공됩니다. 전체 품질로 출력하려면 16:9에서 메가픽셀을 약 1.0으로 올리면 약 1344x768이 됩니다. 이는 H3의 네이티브 캔버스(단변 768px, 최대 768x1344 픽셀)입니다.

ComfyUI 기본 워크플로

MiniMax H3 텍스트 기반 비디오 생성 (T2V)

네이티브 스테레오 오디오와 함께 텍스트 프롬프트에서 비디오를 생성합니다.

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “MiniMax H3 T2V” 검색

모델 다운로드

Diffusion 모델: minimax_h3_fl2va_pruned_int8_convrot

다음 위치에 배치: ComfyUI/models/diffusion_models/

텍스트 인코더: qwen3vl_32b_minimax_h3_int8_convrot

다음 위치에 배치: ComfyUI/models/text_encoders/

VAE: minimax_h3_video_vae_fp16

다음 위치에 배치: ComfyUI/models/vae/

VAE: minimax_h3_audio_vae_fp32

다음 위치에 배치: ComfyUI/models/vae/

모델 저장 위치

프롬프트 팁

  1. 전체 장면 설명: 먼저 전체 장면(위치, 캐릭터, 상황)을 설명한 다음 시간대별로 샷을 나눠서 작성합니다.
  2. 샷, 카메라, 오디오: 하나의 프롬프트 블록에 샷, 카메라 무브, 함께 재생될 오디오(대화, 효과음, 음악)를 함께 설명합니다.
  3. 해상도: H3의 기본 캔버스는 768px 단변, 최대 768x1344 픽셀, 32의 배수로 반올림됩니다.
  4. 길이: 길이 입력은 24fps에서 모델의 17프레임 블록(17k+5) 그리드에 맞춰집니다.
  5. 첫 프레임/마지막 프레임: MiniMaxH3ImageToVideo 노드의 first_frame 및/또는 last_frame에 이미지를 연결하면 이 워크플로를 첫/마지막 프레임 이미지-비디오 변환으로 사용할 수 있습니다.

MiniMax H3 이미지 기반 비디오 생성 (I2V)

입력 이미지에서 비디오를 생성하며, 선택적으로 첫 번째/마지막 프레임 키프레임을 지정할 수 있습니다.

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “MiniMax H3 I2V” 검색

입력 이미지: transparent_rgb_gaming_mouse.png

기본 입력 이미지를 다운로드하거나 자신의 이미지를 사용하세요.

모델 다운로드

Diffusion 모델: minimax_h3_fl2va_pruned_int8_convrot

다음 위치에 배치: ComfyUI/models/diffusion_models/

텍스트 인코더: qwen3vl_32b_minimax_h3_int8_convrot

다음 위치에 배치: ComfyUI/models/text_encoders/

VAE: minimax_h3_video_vae_fp16

다음 위치에 배치: ComfyUI/models/vae/

VAE: minimax_h3_audio_vae_fp32

다음 위치에 배치: ComfyUI/models/vae/

모델 저장 위치

프롬프트 팁

  1. 키프레임: first_framelast_frame 입력은 선택 사항이며, 모델이 두 프레임 사이의 모션을 생성합니다.
  2. 프롬프트: 하나의 블록에 샷, 모션, 함께 재생될 오디오(대화, 효과음, 음악)를 설명합니다.
  3. 해상도: H3의 기본 캔버스는 768px 단변, 최대 768x1344 픽셀, 32의 배수로 반올림됩니다.
  4. 길이: 길이 입력은 24fps에서 모델의 17프레임 블록(17k+5) 그리드에 맞춰집니다.

MiniMax H3 레퍼런스 기반 비디오 생성 (R2V)

레퍼런스 이미지, 비디오, 오디오의 조합에서 캐릭터, 스타일, 모션, 카메라 무브 또는 음성을 고정하여 비디오를 생성합니다.

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “MiniMax H3 R2V” 검색

레퍼런스 이미지: red_superboy_on_city_roof.png

워크플로용 캐릭터 레퍼런스, 또는 자신의 이미지를 사용하세요.

레퍼런스 이미지: mecha_dragon_lightning.png

워크플로용 스타일 및 피사체 레퍼런스, 또는 자신의 이미지를 사용하세요.

모델 다운로드

Diffusion 모델: minimax_h3_ref2va_pruned_int8_convrot

다음 위치에 배치: ComfyUI/models/diffusion_models/

텍스트 인코더: qwen3vl_32b_minimax_h3_int8_convrot

다음 위치에 배치: ComfyUI/models/text_encoders/

VAE: minimax_h3_video_vae_fp16

다음 위치에 배치: ComfyUI/models/vae/

VAE: minimax_h3_audio_vae_fp32

다음 위치에 배치: ComfyUI/models/vae/

모델 저장 위치

프롬프트 팁

  1. 태그로 참조: 연결된 정확한 순서대로 각 입력을 태그로 참조합니다(예: <Picture 1>, <Video 1>, <Audio 1>).
  2. 각 레퍼런스에 역할 지정: 어떤 레퍼런스가 샷의 어떤 부분(정체성, 스타일, 모션, 카메라, 음성)을 담당하는지 명시합니다. 명시적인 지정이 훨씬 잘 작동하는 경향이 있습니다.
  3. 제한 사항: 최대 9개의 레퍼런스 이미지, 3개의 레퍼런스 비디오(각각 자체 사운드트랙 포함 가능), 3개의 독립 레퍼런스 오디오 클립을 사용할 수 있습니다.
  4. ref_image_size: match는 속도를 위해 레퍼런스를 생성 해상도로 축소하고, max는 속도를 희생하더라도 더 강한 정체성 충실도를 위해 최대 2048px 단변을 유지합니다.
  5. 샘플러: res_multistep 샘플러에 beta 또는 normal 스케줄러를 사용하면 레퍼런스가 많은 프롬프트에서 simple보다 좋은 결과를 내는 경향이 있습니다.
  6. 참고: R2V는 T2V 및 I2V 워크플로에서 사용하는 fl2va 모델과 다른 가중치 세트인 ref2va 디퓨전 모델을 사용합니다.