> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMaxH3ReferenceToVideo - ComfyUI Built-in Node Documentation

> Complete documentation for the MiniMaxH3ReferenceToVideo node in ComfyUI. Learn its inputs, outputs, parameters and usage.

MiniMax H3 Reference to Video は、MiniMax H3 のリファレンス・トゥ・ビデオ生成に必要なテキスト条件付けと、空のビデオ潜在表現を作成します。プロンプトに加えて、オプションの参照画像、ビデオ、オーディオクリップを指定すると、ノードはこれらの参照を、モデルが生成中に使用できるトークンにエンコードします。プロンプトは `&lt;Picture i>`、`&lt;Video k>`、`&lt;Audio j>` タグで参照を指定します。

## 入力

| パラメータ         | 説明                                                                                                                                                                                  | データ型   | 必須 | 範囲                     |
| ------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------ | -- | ---------------------- |
| `clip`        | プロンプトのトークン化と、参照メディアの条件付けトークンへのエンコードに使用する CLIP モデル。                                                                                                                                  | CLIP   | 必須 |                        |
| `vae`         | 参照画像と参照ビデオフレームを潜在空間にエンコードするために使用する VAE。                                                                                                                                             | VAE    | 必須 |                        |
| `audio_vae`   | 参照オーディオを潜在空間にエンコードするために使用する VAE（32 kHz のオーディオサンプルレート）。                                                                                                                              | VAE    | 必須 |                        |
| `プロンプト`       | ビデオ用のテキストプロンプト。参照メディアは `&lt;Picture i>`、`&lt;Video k>`、`&lt;Audio j>` タグ（各タイプで 1 始まり）で指定できます。複数行および動的プロンプトに対応しています。                                                                 | STRING | 必須 |                        |
| `幅`           | 生成されるビデオの幅（ピクセル単位）（デフォルト: 1344）。                                                                                                                                                    | INT    | 必須 | 32〜16384 (ステップ 32)     |
| `高さ`          | 生成されるビデオの高さ（ピクセル単位）（デフォルト: 768）。                                                                                                                                                    | INT    | 必須 | 32〜16384 (ステップ 32)     |
| `長さ`          | 24 fps でのフレーム数。124 = 約 5 秒、学習済み範囲は約 124～362（デフォルト: 124）。                                                                                                                            | INT    | 必須 | 5〜3600 (ステップ 17)       |
| `リファレンス画像サイズ` | 参照画像のサイズ変更モード。`match` は各参照画像をアスペクト比を保ったまま生成ピクセル面積に合わせて縮小のみ行います。`max` は参照パイプラインの 2048px 短辺を使用し、被写体の同一性の忠実度を最大化します。参照トークンはすべてのサンプリングステップを通過するため、`max` は数倍遅くなることがあります（デフォルト: `match`）。 | COMBO  | 必須 | `"match"`<br />`"max"` |
| `リファレンス画像`    | オプションの参照画像。各画像は、大きい場合は 2048px の短辺に縮小され、拡大はされません。複数の画像を指定できます。                                                                                                                       | IMAGE  | 任意 | 0〜9                    |
| `リファレンス動画`    | 24 fps（2～15 秒）のオプションの参照ビデオフレーム。複数のビデオを指定できます。                                                                                                                                       | IMAGE  | 任意 | 0〜3                    |
| `リファレンス動画音声`  | 参照ビデオとインデックスでペアリングされるオプションのサウンドトラック。`ref_video_audio_N` は同じ番号の `ref_video_N` のサウンドトラックです。                                                                                           | AUDIO  | 任意 | 0〜3                    |
| `リファレンス音声`    | オプションのスタンドアロン参照オーディオクリップ。                                                                                                                                                           | AUDIO  | 任意 | 0〜3                    |

注記:

* プロンプトは、タイプごとに 1 始まりのタグで参照メディアを指定します。画像には `&lt;Picture i>`、ビデオには `&lt;Video k>`、オーディオには `&lt;Audio j>` を使用します。参照メディアは固定の順序でモデルに提示されます。まず画像、次にビデオ（各サウンドトラックの `&lt;Audio j>` ラベルは対応する `&lt;Video k>` の直前）、最後にスタンドアロンオーディオです。
* 参照ビデオには少なくとも 5 フレーム（24 fps で約 0.2 秒）が必要です。それ未満の場合はノードがエラーを発生させます。ビデオフレームはまた、選択された `length` に上限され、サポートされているフレーム数に切り詰められます。

## 出力

| 出力名      | 説明                                                                   | データ型         |
| -------- | -------------------------------------------------------------------- | ------------ |
| `ポジティブ`  | MiniMax H3 モデルが使用する、エンコードされたプロンプトとエンコード済みの参照画像・ビデオ・オーディオトークンを含む条件付け。 | CONDITIONING |
| `latent` | 要求された `幅`、`高さ`、`長さ`（フレーム数）の空のオーディオビデオ潜在表現。                           | LATENT       |

> このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください！ [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/MiniMaxH3ReferenceToVideo/ja.md)

***

**Source fingerprint (SHA-256):** `529e51c5c9c63a94176a15851f40ac42f7bd93e7d7c6ad334ed22aa29d04dfde`
