> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax H3: ComfyUI 워크플로 예시

> ComfyUI에서 오픈 가중치 MiniMax H3를 사용하는 방법을 알아보세요. 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 레퍼런스 기반 비디오 생성을 위한 네이티브 워크플로를 제공하며, 모든 기능에서 네이티브 스테레오 오디오를 지원합니다.

[MiniMax H3](https://www.minimax.io/blog/minimax-h3)는 MiniMax의 범용 옴니모달 생성 모델로, 현재 오픈 가중치로 제공됩니다. 이 모델은 단일 컨텍스트에서 텍스트, 이미지, 비디오, 오디오를 함께 이해하며, **네이티브 스테레오 오디오**로 비디오를 생성합니다. 음성, 사운드 효과, 음악이 이후에 덧붙여지는 대신 단일 포워드 패스에서 함께 모델링됩니다. 출력은 최대 2K 해상도, 24fps, 약 15초입니다.

ComfyUI는 MiniMax H3를 네이티브로 지원합니다. 템플릿 라이브러리에는 현재 각각 하나의 생성 모드를 다루는 예제 워크플로 3개가 제공됩니다:

* **텍스트 기반 비디오 생성** (T2V): 텍스트 프롬프트에서 비디오를 생성합니다
* **이미지 기반 비디오 생성** (I2V): 입력 이미지에서 비디오를 생성하며, 선택적으로 첫 번째/마지막 프레임 제어 옵션을 지원합니다
* **레퍼런스 기반 비디오 생성** (R2V): 레퍼런스 이미지, 비디오, 오디오에서 캐릭터, 스타일, 모션, 카메라 무브 또는 음성을 고정하여 비디오를 생성합니다

이 세 가지는 예제 템플릿이며 모델의 전체 기능을 나열한 것이 아닙니다. 네이티브 MiniMax H3 노드를 통해 더 많은 생성 모드를 사용할 수 있습니다: `MiniMaxH3ImageToVideo` 노드로 첫 번째/마지막 프레임 이미지-비디오 생성(fl2va), `MiniMaxH3ReferenceToVideo` 노드로 이미지, 비디오, 오디오 레퍼런스 기반 생성(ref2va)이 가능합니다. 이 노드들로 추가 워크플로를 직접 구축할 수도 있습니다.

<UpdateReminder />

## 주요 기능

* **네이티브 스테레오 오디오**: 대화, 사운드 효과, 음악이 비디오와 함께 생성되어 하나의 MP4로 동기화됩니다
* **멀티모달 컨텍스트**: 텍스트, 이미지, 비디오 및 오디오 참조를 하나의 생성에서 결합할 수 있습니다
* **참조 기반 생성**: 참조 자료에서 캐릭터의 정체성, 스타일, 모션, 카메라 이동 또는 음성을 고정합니다
* **지시 따르기**: 참조와 대상 샷 간의 관계를 자연 언어로 설명합니다
* **정확한 텍스트 렌더링**: 철자로 표기된 텍스트와 브랜드 요소가 깔끔하게 렌더링됩니다
* **오픈 가중치**: 모든 매개변수를 완전히 제어하면서 ComfyUI에서 로컬로 실행합니다

## 시작하기

MiniMax H3는 오픈 가중치로 ComfyUI에서 지원됩니다. 시작하려면:

1. ComfyUI를 0.30.0 이상으로 업데이트합니다
2. **템플릿 라이브러리** > **비디오**로 이동하여 원하는 MiniMax H3 워크플로를 선택합니다
3. 팝업 안내에 따라 모델을 다운로드하고 워크플로를 실행합니다

모델 파일은 Hugging Face의 [Comfy-Org/MiniMax-H3](https://huggingface.co/Comfy-Org/MiniMax-H3) 저장소에서 호스팅됩니다.

## 출력 해상도 설정

각 워크플로는 **Resolution Selector(해상도 선택기)** 노드를 사용하여 전체 출력 크기를 제어합니다. 이 노드는 세 가지 설정에서 `width`와 `height`를 계산하며, 출력은 MiniMax H3 노드의 `width` 및 `height` 입력에 직접 연결됩니다:

* **화면 비율**: `16:9 (Widescreen)`, `9:16 (Portrait Widescreen)`, `1:1 (Square)` 같은 프리셋을 선택합니다
* **메가픽셀**: 출력의 목표 총 픽셀 수. 값이 클수록 더 큰 프레임이 생성되고, 작을수록 더 빠르게 생성됩니다
* **배수**: 계산된 해상도는 이 값의 가장 가까운 배수로 반올림됩니다. H3의 해상도 그리드에 맞게 `32`로 유지합니다

템플릿은 빠른 미리보기 크기로 제공됩니다. 전체 품질로 출력하려면 16:9에서 메가픽셀을 약 `1.0`으로 올리면 약 1344x768이 됩니다. 이는 H3의 네이티브 캔버스(단변 768px, 최대 768x1344 픽셀)입니다.

## ComfyUI 기본 워크플로

### MiniMax H3 텍스트 기반 비디오 생성 (T2V)

네이티브 스테레오 오디오와 함께 텍스트 프롬프트에서 비디오를 생성합니다.

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/video_minimax_h3_t2v.mp4" />

<CardGroup cols={2}>
  <Card title="Comfy Cloud에서 실행" icon="cloud" href="https://cloud.comfy.org/?template=video_minimax_h3_t2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3">
    Comfy Cloud에서 열기
  </Card>

  <Card title="워크플로 다운로드" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json">
    JSON 다운로드 또는 템플릿 라이브러리에서 "MiniMax H3 T2V" 검색
  </Card>
</CardGroup>

#### 모델 다운로드

<CardGroup cols={2}>
  <Card title="Diffusion 모델: minimax_h3_fl2va_pruned_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/diffusion\_models/</code>
  </Card>

  <Card title="텍스트 인코더: qwen3vl_32b_minimax_h3_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/text\_encoders/</code>
  </Card>

  <Card title="VAE: minimax_h3_video_vae_fp16" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/vae/</code>
  </Card>

  <Card title="VAE: minimax_h3_audio_vae_fp32" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/vae/</code>
  </Card>
</CardGroup>

#### 모델 저장 위치

```
ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors
```

#### 프롬프트 팁

1. **전체 장면 설명**: 먼저 전체 장면(위치, 캐릭터, 상황)을 설명한 다음 시간대별로 샷을 나눠서 작성합니다.
2. **샷, 카메라, 오디오**: 하나의 프롬프트 블록에 샷, 카메라 무브, 함께 재생될 오디오(대화, 효과음, 음악)를 함께 설명합니다.
3. **해상도**: H3의 기본 캔버스는 768px 단변, 최대 768x1344 픽셀, 32의 배수로 반올림됩니다.
4. **길이**: 길이 입력은 24fps에서 모델의 17프레임 블록(17k+5) 그리드에 맞춰집니다.
5. **첫 프레임/마지막 프레임**: `MiniMaxH3ImageToVideo` 노드의 `first_frame` 및/또는 `last_frame`에 이미지를 연결하면 이 워크플로를 첫/마지막 프레임 이미지-비디오 변환으로 사용할 수 있습니다.

***

### MiniMax H3 이미지 기반 비디오 생성 (I2V)

입력 이미지에서 비디오를 생성하며, 선택적으로 첫 번째/마지막 프레임 키프레임을 지정할 수 있습니다.

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/video_minimax_h3_i2v.mp4" />

<CardGroup cols={2}>
  <Card title="Comfy Cloud에서 실행" icon="cloud" href="https://cloud.comfy.org/?template=video_minimax_h3_i2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3">
    Comfy Cloud에서 열기
  </Card>

  <Card title="워크플로 다운로드" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_i2v.json">
    JSON 다운로드 또는 템플릿 라이브러리에서 "MiniMax H3 I2V" 검색
  </Card>
</CardGroup>

<CardGroup cols={1}>
  <Card title="입력 이미지: transparent_rgb_gaming_mouse.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/transparent_rgb_gaming_mouse.png">
    기본 입력 이미지를 다운로드하거나 자신의 이미지를 사용하세요.
  </Card>
</CardGroup>

#### 모델 다운로드

<CardGroup cols={2}>
  <Card title="Diffusion 모델: minimax_h3_fl2va_pruned_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/diffusion\_models/</code>
  </Card>

  <Card title="텍스트 인코더: qwen3vl_32b_minimax_h3_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/text\_encoders/</code>
  </Card>

  <Card title="VAE: minimax_h3_video_vae_fp16" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/vae/</code>
  </Card>

  <Card title="VAE: minimax_h3_audio_vae_fp32" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/vae/</code>
  </Card>
</CardGroup>

#### 모델 저장 위치

```
ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors
```

#### 프롬프트 팁

1. **키프레임**: `first_frame`과 `last_frame` 입력은 선택 사항이며, 모델이 두 프레임 사이의 모션을 생성합니다.
2. **프롬프트**: 하나의 블록에 샷, 모션, 함께 재생될 오디오(대화, 효과음, 음악)를 설명합니다.
3. **해상도**: H3의 기본 캔버스는 768px 단변, 최대 768x1344 픽셀, 32의 배수로 반올림됩니다.
4. **길이**: 길이 입력은 24fps에서 모델의 17프레임 블록(17k+5) 그리드에 맞춰집니다.

***

### MiniMax H3 레퍼런스 기반 비디오 생성 (R2V)

레퍼런스 이미지, 비디오, 오디오의 조합에서 캐릭터, 스타일, 모션, 카메라 무브 또는 음성을 고정하여 비디오를 생성합니다.

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/video_minimax_h3_r2v.mp4" />

<CardGroup cols={2}>
  <Card title="Comfy Cloud에서 실행" icon="cloud" href="https://cloud.comfy.org/?template=video_minimax_h3_r2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3">
    Comfy Cloud에서 열기
  </Card>

  <Card title="워크플로 다운로드" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_r2v.json">
    JSON 다운로드 또는 템플릿 라이브러리에서 "MiniMax H3 R2V" 검색
  </Card>
</CardGroup>

<CardGroup cols={2}>
  <Card title="레퍼런스 이미지: red_superboy_on_city_roof.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/red_superboy_on_city_roof.png">
    워크플로용 캐릭터 레퍼런스, 또는 자신의 이미지를 사용하세요.
  </Card>

  <Card title="레퍼런스 이미지: mecha_dragon_lightning.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/mecha_dragon_lightning.png">
    워크플로용 스타일 및 피사체 레퍼런스, 또는 자신의 이미지를 사용하세요.
  </Card>
</CardGroup>

#### 모델 다운로드

<CardGroup cols={2}>
  <Card title="Diffusion 모델: minimax_h3_ref2va_pruned_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/diffusion\_models/</code>
  </Card>

  <Card title="텍스트 인코더: qwen3vl_32b_minimax_h3_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/text\_encoders/</code>
  </Card>

  <Card title="VAE: minimax_h3_video_vae_fp16" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/vae/</code>
  </Card>

  <Card title="VAE: minimax_h3_audio_vae_fp32" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors">
    다음 위치에 배치: <code>ComfyUI/models/vae/</code>
  </Card>
</CardGroup>

#### 모델 저장 위치

```
ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors
```

#### 프롬프트 팁

1. **태그로 참조**: 연결된 정확한 순서대로 각 입력을 태그로 참조합니다(예: `<Picture 1>`, `<Video 1>`, `<Audio 1>`).
2. **각 레퍼런스에 역할 지정**: 어떤 레퍼런스가 샷의 어떤 부분(정체성, 스타일, 모션, 카메라, 음성)을 담당하는지 명시합니다. 명시적인 지정이 훨씬 잘 작동하는 경향이 있습니다.
3. **제한 사항**: 최대 9개의 레퍼런스 이미지, 3개의 레퍼런스 비디오(각각 자체 사운드트랙 포함 가능), 3개의 독립 레퍼런스 오디오 클립을 사용할 수 있습니다.
4. **ref\_image\_size**: `match`는 속도를 위해 레퍼런스를 생성 해상도로 축소하고, `max`는 속도를 희생하더라도 더 강한 정체성 충실도를 위해 최대 2048px 단변을 유지합니다.
5. **샘플러**: `res_multistep` 샘플러에 `beta` 또는 `normal` 스케줄러를 사용하면 레퍼런스가 많은 프롬프트에서 `simple`보다 좋은 결과를 내는 경향이 있습니다.
6. **참고**: R2V는 T2V 및 I2V 워크플로에서 사용하는 `fl2va` 모델과 다른 가중치 세트인 `ref2va` 디퓨전 모델을 사용합니다.
