MiniMax H3 텍스트 기반 비디오 생성 (T2V)
텍스트 프롬프트로 네이티브 스테레오 오디오가 포함된 비디오를 생성합니다.Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “MiniMax H3 T2V”를 검색하세요.
모델 다운로드
Diffusion 모델: minimax_h3_fl2va_pruned_int8_convrot
ComfyUI/models/diffusion_models/ 폴더에 넣으세요.텍스트 인코더: qwen3vl_32b_minimax_h3_nvfp4_awq
ComfyUI/models/text_encoders/ 폴더에 넣으세요.VAE: minimax_h3_video_vae_fp16
ComfyUI/models/vae/ 폴더에 넣으세요.VAE: minimax_h3_audio_vae_fp32
ComfyUI/models/vae/ 폴더에 넣으세요.LoRA: minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16
워크플로의 모델 스캔에 필요하며, 선택 사양인 Lightning LoRA 터보 모드를 지원합니다.
ComfyUI/models/loras/ 폴더에 넣으세요.모델 저장 위치
프롬프트 작성 팁
- 전체 장면 설명: 먼저 전체 장면(위치, 캐릭터, 어떤 일이 일어나고 있는지)을 설명한 다음, 시간대별 샷으로 나누어 작성하세요
- 샷, 카메라, 오디오: 샷, 카메라 무빙, 그리고 함께 제공되는 오디오(대사, SFX, 음악)를 하나의 프롬프트 블록에서 설명하세요
- 해상도: H3의 기본 캔버스는 짧은 변이 768px이며, 16:9 비율에서는 1344x768입니다. 해상도는 32의 배수로 반올림됩니다
- 재생 시간: 재생 시간 입력은 24fps에서 모델의 블록당 17프레임(17k+5) 그리드에 맞춰집니다
- 첫 번째/마지막 프레임:
MiniMaxH3ImageToVideo노드의first_frame및/또는last_frame에 이미지를 연결하면 이 워크플로를 첫 번째/마지막 프레임 이미지 기반 비디오 생성으로 전환할 수 있습니다 - 터보 모드(선택 사항): 기본 워크플로는 20스텝으로 생성합니다. 더 나은 모션 품질을 위해 스텝 수를 늘리세요(예: 25). MiniMax H3 노드에서
turbo_mode를 활성화하면 포함된 Lightning LoRA(minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16)를 8스텝으로 사용하여 훨씬 빠르게 생성할 수 있으며, 오디오와 모션 품질은 다소 낮아집니다
MiniMax H3 이미지 기반 비디오 생성 (I2V)
입력 이미지에서 비디오를 생성하며, 선택적으로 첫/마지막 프레임 키프레임을 지정할 수 있습니다.Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “MiniMax H3 I2V”를 검색하세요.
입력 이미지: transparent_rgb_gaming_mouse.png
기본 입력 이미지를 다운로드하거나 직접 준비한 이미지를 사용하세요.
모델 다운로드
Diffusion 모델: minimax_h3_fl2va_pruned_int8_convrot
ComfyUI/models/diffusion_models/ 폴더에 넣으세요.텍스트 인코더: qwen3vl_32b_minimax_h3_nvfp4_awq
ComfyUI/models/text_encoders/ 폴더에 넣으세요.VAE: minimax_h3_video_vae_fp16
ComfyUI/models/vae/ 폴더에 넣으세요.VAE: minimax_h3_audio_vae_fp32
ComfyUI/models/vae/ 폴더에 넣으세요.터보 LoRA: minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16
ComfyUI/models/loras/ 폴더에 넣으세요. turbo_mode 활성화 시 사용됩니다.모델 저장 위치
프롬프트 작성 팁
- 키프레임:
first_frame및last_frame입력은 선택 사항이며, 모델이 그 사이의 모션을 생성합니다 - 프롬프트: 샷, 모션, 그리고 함께 제공되는 오디오(대사, SFX, 음악)를 하나의 블록에서 설명하세요
- 해상도: H3의 기본 캔버스는 짧은 변이 768px이며, 16:9 비율에서는 1344x768입니다. 해상도는 32의 배수로 반올림됩니다
- 재생 시간: 재생 시간 입력은 24fps에서 모델의 블록당 17프레임(17k+5) 그리드에 맞춰집니다
- 터보 모드: MiniMax H3 노드에서
turbo_mode를 활성화하면 터보 LoRA로 전환되어 20스텝 대신turbo_steps(기본값 8)로 생성합니다.turbo_model_strength는 LoRA 강도를 제어합니다(기본값 1.0).
MiniMax H3 레퍼런스 기반 비디오 생성 (R2V)
레퍼런스 이미지, 비디오, 오디오를 조합하여 캐릭터, 스타일, 모션, 카메라 무빙, 목소리를 고정한 비디오를 생성합니다.Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “MiniMax H3 R2V”를 검색하세요.
레퍼런스 이미지: red_superboy_on_city_roof.png
워크플로의 캐릭터 레퍼런스입니다. 직접 만든 이미지를 사용해도 됩니다.
레퍼런스 이미지: mecha_dragon_lightning.png
워크플로의 스타일 및 피사체 레퍼런스입니다. 직접 만든 이미지를 사용해도 됩니다.
모델 다운로드
Diffusion 모델: minimax_h3_ref2va_pruned_int8_convrot
ComfyUI/models/diffusion_models/ 폴더에 넣으세요.텍스트 인코더: qwen3vl_32b_minimax_h3_nvfp4_awq
ComfyUI/models/text_encoders/ 폴더에 넣으세요.VAE: minimax_h3_video_vae_fp16
ComfyUI/models/vae/ 폴더에 넣으세요.VAE: minimax_h3_audio_vae_fp32
ComfyUI/models/vae/ 폴더에 넣으세요.LoRA: minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16
워크플로의 모델 스캔에 필요하며, 선택 사양인 Lightning LoRA 터보 모드를 지원합니다.
ComfyUI/models/loras/ 폴더에 넣으세요.모델 저장 위치
프롬프트 작성 팁
- 태그로 레퍼런스 지정: 연결한 순서대로 태그를 사용해 각 입력을 참조하세요. 예:
<Picture 1>,<Video 1>,<Audio 1> - 레퍼런스에 역할 부여: 어떤 레퍼런스가 샷의 어떤 부분(아이덴티티, 스타일, 모션, 카메라, 목소리)을 담당하는지 명시하세요. 역할을 명확히 지정할수록 결과가 훨씬 좋아집니다
- 제한: 레퍼런스 이미지 최대 9개, 레퍼런스 비디오 최대 3개(각각 자체 사운드트랙 포함 가능), 독립적인 레퍼런스 오디오 최대 3개
- ref_image_size:
match는 속도를 위해 레퍼런스를 생성 해상도에 맞춰 축소합니다.max는 최대 2048px 짧은 변을 유지하여 속도는 희생하지만 아이덴티티 충실도를 높입니다 - 참고: R2V는
ref2vaDiffusion 모델을 사용하며, T2V 및 I2V 워크플로에서 사용하는fl2va모델과는 다른 가중치 세트입니다 - 터보 모드(선택 사항): 기본 워크플로는 20스텝으로 생성합니다. 더 나은 모션 품질을 위해 스텝 수를 늘리세요(예: 25). Lightning LoRA 체크박스를 활성화하면 4스텝 터보 LoRA(
minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16)를 사용하여 훨씬 빠르게 생성할 수 있으며, 오디오와 모션 품질은 다소 낮아집니다
기본 노드를 사용한 고급 워크플로
기본 MiniMax H3 노드는 최근 ComfyUI 업데이트에서 도입된 두 가지 추가 워크플로를 지원합니다. 이 워크플로를 사용하려면 ComfyUI를 최신 버전으로 업데이트하세요.임의의 프레임에 가이드 고정 (#15439)
Comfy-Org/ComfyUI#15439에서MiniMaxH3AddGuide 노드가 추가되었습니다. 그 이전에는 키프레임을 비디오의 첫 번째와 마지막 프레임에만 고정할 수 있었습니다. 이 노드는 그러한 제한을 없애 가이드를 연속된 시간 축의 임의의 프레임에 고정할 수 있게 해 줍니다.
MiniMax H3 노드의 positive 및 잠재 데이터 출력을 MiniMaxH3AddGuide에 연결한 다음, 가이드 입력을 최소 한 개 제공하세요.
- image: 정지 이미지 또는 클립입니다. 여러 프레임으로 구성된 배치는 클립으로 고정된 후 모델의 유효 클립 길이인 5, 22, 39… 프레임(17k+5)에 맞춰 크롭됩니다. 5프레임보다 짧은 배치는 첫 번째 이미지만 사용합니다.
- audio: 동일한 프레임 인덱스에 고정되는 오디오입니다. 비디오의 남은 재생 시간에 맞춰 크롭됩니다.
- frame_idx: 가이드를 고정할 프레임입니다. 음수 값은 비디오의 끝에서부터 계산합니다.
vae에 연결하고, 오디오를 제공할 때는 오디오 VAE를 audio_vae에 연결하세요. MiniMaxH3AddGuide 노드를 여러 개 연결하면 여러 프레임에 가이드를 고정할 수 있습니다.
예를 들어 기존 비디오의 처음 22프레임과 해당 오디오를 프레임 0의 MiniMaxH3AddGuide에 입력하면, 모델은 비디오와 오디오 두 스트림 모두의 이어지는 내용을 생성합니다. 또는 124프레임 비디오의 프레임 60에 정지 이미지를 배치하면 비디오가 해당 프레임을 지나가도록 강제할 수 있습니다.
첫 번째/마지막 프레임 고정은 이전과 동일한 좌표를 생성하므로 기존 워크플로는 변경 없이 계속 작동합니다.
Multiframe Reference 템플릿은 이 노드를 기반으로 한 즉시 사용 가능한 워크플로입니다.
잠재 데이터 노이즈 마스크를 사용한 인페인팅 및 확장 (#15375)
Comfy-Org/ComfyUI#15375에서 MiniMax H3용 토큰별 노이즈 마스크가 추가되어 비디오와 오디오 잠재 데이터 모두에 적용할 수 있습니다. 이제 비디오의 일부만 다시 생성하고 나머지는 고정된 상태로 유지할 수 있습니다. 평소와 같이 샘플러의denoise_mask 입력에 마스크를 연결하세요. 값이 0이면 해당 잠재 데이터 영역이 보존되고, 1이면 해당 영역이 다시 생성됩니다. 비디오 마스크는 모델의 2x2 잠재 패치 그리드에 정렬되고, 오디오 마스크는 잠재 프레임 전체 단위로 정렬됩니다. 로컬 인페인팅, 객체 제거, 또는 기존 콘텐츠를 안정적으로 유지하면서 클립을 확장하는 데 사용할 수 있습니다.