> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax H3: ComfyUI ワークフロー例

> オープンウェイトのMiniMax H3をComfyUIで使用する方法を学びます。テキストから動画へ、画像から動画へ、参照から動画へのネイティブワークフローを備え、すべてネイティブのステレオオーディオに対応しています。

[MiniMax H3](https://www.minimax.io/blog/minimax-h3) は、MiniMaxの汎用オムニモーダル生成モデルで、現在はオープンウェイトとして公開されています。テキスト、画像、ビデオ、オーディオを単一のコンテキストで統合的に理解し、**ネイティブステレオオーディオ**付きのビデオを生成します。つまり、音声、サウンドエフェクト、音楽は、後から重ね合わせるのではなく、単一のフォワードパスでまとめてモデル化されます。出力は最大2K解像度、24fps、約15秒です。

ComfyUI は MiniMax H3 をネイティブにサポートしています。テンプレートライブラリには現在、それぞれ 1 つの生成モードをカバーする 3 つのサンプルワークフローが用意されています：

* **テキストから動画へ**（T2V）: テキストプロンプトからビデオを生成
* **画像から動画へ**（I2V）: 入力画像からビデオを生成。オプションで先頭/末尾フレームの制御が可能
* **参照から動画**（R2V）: 参照画像、ビデオ、オーディオから、キャラクター、スタイル、モーション、カメラワーク、または音声を固定したビデオを生成

これら 3 つはサンプルテンプレートであり、モデルの全機能を網羅したものではありません。ネイティブの MiniMax H3 ノードを使うと、より多くの生成モードに対応できます：`MiniMaxH3ImageToVideo` ノードによる先頭/末尾フレームの画像からビデオ生成（fl2va）、`MiniMaxH3ReferenceToVideo` ノードによる画像・ビデオ・オーディオ参照駆動の生成（ref2va）。これらのノードで追加のワークフローを構築することもできます。

<UpdateReminder />

## 主な機能

* **ネイティブステレオオーディオ**: 会話、効果音、音楽がビデオと一緒に生成され、1つのMP4に同期されます
* **マルチモーダルコンテキスト**: テキスト、画像、ビデオ、オーディオリファレンスを1回の生成で組み合わせることができます
* **リファレンス駆動の生成**: リファレンス素材からキャラクターのアイデンティティ、スタイル、モーション、カメラの動き、または音声を固定できます
* **指示への追従**: リファレンスと目的のショットの関係を自然言語で記述します
* **正確なテキストレンダリング**: スペルアウトされたテキストとブランド要素がきれいにレンダリングされます
* **オープンウェイト**: ComfyUIでローカルに実行でき、すべてのパラメータを完全に制御できます

## はじめに

MiniMax H3はオープンウェイトで、ComfyUIでサポートされています。はじめるには：

1. ComfyUI を 0.30.0 以降に更新します
2. **テンプレートライブラリ** > **ビデオ** の順に移動し、任意のMiniMax H3ワークフローを選択します
3. ポップアップに従ってモデルをダウンロードし、ワークフローを実行します

モデルファイルは Hugging Face の [Comfy-Org/MiniMax-H3](https://huggingface.co/Comfy-Org/MiniMax-H3) リポジトリでホストされています。

## 出力解像度の設定

各ワークフローでは、**Resolution Selector（解像度セレクタ）** ノードを使って全体の出力サイズを制御します。このノードは3つの設定から `width` と `height` を計算し、その出力は MiniMax H3 ノードの `width` と `height` 入力に直接接続されます：

* **アスペクト比**：`16:9 (Widescreen)`、`9:16 (Portrait Widescreen)`、`1:1 (Square)` などのプリセットを選択します
* **メガピクセル**：出力の目標総ピクセル数。値が大きいほど大きなフレームになり、小さいほど高速に生成されます
* **倍数**：計算された解像度はこの数値の最も近い倍数に丸められます。H3 の解像度グリッドに合わせて `32` のままにします

テンプレートは高速なプレビューサイズになっています。フル品質で出力するには、16:9 でメガピクセルを約 `1.0` に上げると、およそ 1344x768 になります。これは H3 のネイティブキャンバス（短辺 768px、上限 768x1344 ピクセル）です。

## ComfyUI のネイティブワークフロー

### MiniMax H3 テキストからビデオ生成 (T2V)

テキストプロンプトから、ネイティブのステレオオーディオ付きビデオを生成します。

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/video_minimax_h3_t2v.mp4" />

<CardGroup cols={2}>
  <Card title="Comfy Cloud で実行" icon="cloud" href="https://cloud.comfy.org/?template=video_minimax_h3_t2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3">
    Comfy Cloud で開く
  </Card>

  <Card title="ワークフローをダウンロード" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json">
    JSON をダウンロードするか、テンプレートライブラリで「MiniMax H3 T2V」を検索してください
  </Card>
</CardGroup>

#### モデルのダウンロード

<CardGroup cols={2}>
  <Card title="Diffusion モデル: minimax_h3_fl2va_pruned_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors">
    <code>ComfyUI/models/diffusion\_models/</code> に配置してください
  </Card>

  <Card title="テキストエンコーダー: qwen3vl_32b_minimax_h3_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors">
    <code>ComfyUI/models/text\_encoders/</code> に配置してください
  </Card>

  <Card title="VAE: minimax_h3_video_vae_fp16" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors">
    <code>ComfyUI/models/vae/</code> に配置してください
  </Card>

  <Card title="VAE: minimax_h3_audio_vae_fp32" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors">
    <code>ComfyUI/models/vae/</code> に配置してください
  </Card>
</CardGroup>

#### モデルの保存場所

```
ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors
```

#### プロンプト作成のヒント

1. **シーン全体を記述する**: まずシーン全体（場所、キャラクター、何が起きているか）を説明し、次に時間単位のショットに分割します
2. **ショット、カメラ、オーディオ**: ショット、カメラの動き、それに伴うオーディオ（セリフ、効果音、音楽）を1つのプロンプトブロックにまとめて記述します
3. **解像度**: H3 のネイティブキャンバスは短辺 768px で、上限は 768x1344 ピクセルであり、32 の倍数に丸められます
4. **再生時間**: 再生時間の入力は、24fps におけるモデルの 17 フレーム単位のブロック（17k+5）のグリッドにスナップされます
5. **先頭/末尾フレーム**: `MiniMaxH3ImageToVideo` ノードの `first_frame` や `last_frame` に画像を接続すると、このワークフローを先頭/末尾フレームの画像から動画への変換に利用できます

\---### MiniMax H3 画像からビデオへ (I2V)

入力画像からビデオを生成します。最初と最後のフレームのキーフレームをオプションで指定できます。

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/video_minimax_h3_i2v.mp4" />

<CardGroup cols={2}>
  <Card title="Comfy Cloud で実行" icon="cloud" href="https://cloud.comfy.org/?template=video_minimax_h3_i2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3">
    Comfy Cloud で開く
  </Card>

  <Card title="ワークフローをダウンロード" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_i2v.json">
    JSON をダウンロードするか、テンプレートライブラリで「MiniMax H3 I2V」を検索してください
  </Card>
</CardGroup>

<CardGroup cols={1}>
  <Card title="入力画像: transparent_rgb_gaming_mouse.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/transparent_rgb_gaming_mouse.png">
    デフォルトの入力画像をダウンロードするか、ご自身の画像を使用してください。
  </Card>
</CardGroup>

#### モデルのダウンロード

<CardGroup cols={2}>
  <Card title="Diffusion Model: minimax_h3_fl2va_pruned_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors">
    <code>ComfyUI/models/diffusion\_models/</code> に配置してください
  </Card>

  <Card title="テキストエンコーダー: qwen3vl_32b_minimax_h3_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors">
    <code>ComfyUI/models/text\_encoders/</code> に配置してください
  </Card>

  <Card title="VAE: minimax_h3_video_vae_fp16" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors">
    <code>ComfyUI/models/vae/</code> に配置してください
  </Card>

  <Card title="VAE: minimax_h3_audio_vae_fp32" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors">
    <code>ComfyUI/models/vae/</code> に配置してください
  </Card>
</CardGroup>

#### モデルの保存場所

```
ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors
```

#### プロンプトのヒント

1. **キーフレーム**: `first_frame` と `last_frame` の入力はオプションです。モデルはこれらの間の動きを生成します
2. **プロンプト**: ショット、動き、および付随するオーディオ（会話、効果音、音楽）を 1 つのブロックで記述します
3. **解像度**: H3 のネイティブキャンバスは短辺 768px で、768x1344 ピクセルに制限され、32 の倍数に丸められます
4. **再生時間**: 再生時間の入力は、24fps におけるモデルの 17 フレーム単位のブロック（17k+5）グリッドにスナップします

\---### MiniMax H3 参照からビデオ生成（R2V）

参照画像、ビデオ、オーディオの任意の組み合わせから、キャラクター、スタイル、モーション、カメラワーク、音声を固定したビデオを生成します。

<video controls className="w-full aspect-video" src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/output/video_minimax_h3_r2v.mp4" />

<CardGroup cols={2}>
  <Card title="Comfy Cloud で実行" icon="cloud" href="https://cloud.comfy.org/?template=video_minimax_h3_r2v&utm_source=docs&utm_medium=referral&utm_campaign=minimax-h3">
    Comfy Cloud で開く
  </Card>

  <Card title="ワークフローをダウンロード" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_r2v.json">
    JSON をダウンロードするか、テンプレートライブラリで「MiniMax H3 R2V」を検索してください
  </Card>
</CardGroup>

<CardGroup cols={2}>
  <Card title="参照画像: red_superboy_on_city_roof.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/red_superboy_on_city_roof.png">
    このワークフロー用のキャラクター参照です。ご自身の画像を使用することもできます。
  </Card>

  <Card title="参照画像: mecha_dragon_lightning.png" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/mecha_dragon_lightning.png">
    このワークフロー用のスタイルと被写体の参照です。ご自身の画像を使用することもできます。
  </Card>
</CardGroup>

#### モデルのダウンロード

<CardGroup cols={2}>
  <Card title="Diffusion Model: minimax_h3_ref2va_pruned_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors">
    <code>ComfyUI/models/diffusion\_models/</code> に配置してください
  </Card>

  <Card title="Text Encoder: qwen3vl_32b_minimax_h3_int8_convrot" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors">
    <code>ComfyUI/models/text\_encoders/</code> に配置してください
  </Card>

  <Card title="VAE: minimax_h3_video_vae_fp16" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors">
    <code>ComfyUI/models/vae/</code> に配置してください
  </Card>

  <Card title="VAE: minimax_h3_audio_vae_fp32" icon="download" href="https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors">
    <code>ComfyUI/models/vae/</code> に配置してください
  </Card>
</CardGroup>

#### モデルの保存場所

```
ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors
```

#### プロンプトのヒント

1. **タグによる参照**: 各入力を、接続された順序どおりにタグで参照します。例: `<Picture 1>`、`<Video 1>`、`<Audio 1>`
2. **各参照にジョブを割り当てる**: どの参照がショットのどの部分（アイデンティティ、スタイル、モーション、カメラ、音声）を担当するかを明示します。明示的な割り当ての方がはるかに良い結果が得られる傾向があります。
3. **制限**: 参照画像は最大9枚、参照ビデオは最大3本（それぞれ独自のサウンドトラックを持つことができます）、スタンドアロンの参照オーディオクリップは最大3つまで使用できます。
4. **ref\_image\_size**: `match` は参照を生成解像度に縮小して高速化します。`max` は短辺を最大2048pxに保つことでアイデンティティの忠実度を高めますが、速度は低下します。
5. **サンプラー**: 参照が多いプロンプトでは、`beta` または `normal` scheduler を使用した `res_multistep` が `simple` よりも良い結果を出す傾向があります。
6. **注意**: R2V は `ref2va` diffusion モデルを使用します。これは T2V および I2V ワークフローで使用される `fl2va` モデルとは異なる重みセットです。
