> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMaxH3ReferenceToVideo - ComfyUI Built-in Node Documentation

> Complete documentation for the MiniMaxH3ReferenceToVideo node in ComfyUI. Learn its inputs, outputs, parameters and usage.

MiniMax H3 参考转视频（Reference to Video）节点创建文本条件化以及 MiniMax H3 参考转视频生成所需的空视频潜在表示。您提供提示词以及可选的参考图像、视频和音频片段，节点会将这些参考内容编码为模型在生成时可使用的标记。提示词通过 `&lt;Picture i>`、`&lt;Video k>` 和 `&lt;Audio j>` 标签引用参考内容。

## 输入

| 参数                 | 描述                                                                                                                           | 数据类型   | 必需 | 范围                     |
| ------------------ | ---------------------------------------------------------------------------------------------------------------------------- | ------ | -- | ---------------------- |
| `clip`             | 用于对提示词进行分词并将参考媒体编码为条件化标记的 CLIP 模型。                                                                                           | CLIP   | 是  |                        |
| `vae`              | 用于将参考图像和参考视频帧编码到潜在空间的 VAE。                                                                                                   | VAE    | 是  |                        |
| `audio_vae`        | 用于将参考音频编码到潜在空间的 VAE（32 kHz 音频采样率）。                                                                                           | VAE    | 是  |                        |
| `prompt`           | 视频的文本提示词。可以使用 `&lt;Picture i>`、`&lt;Video k>` 和 `&lt;Audio j>` 标签（每种类型从 1 开始编号）引用参考媒体。支持多行和动态提示词。                            | STRING | 是  |                        |
| `width`            | 生成视频的宽度（像素，默认：1344）。                                                                                                         | INT    | 是  | 32 到 16384 (步长 32)     |
| `height`           | 生成视频的高度（像素，默认：768）。                                                                                                          | INT    | 是  | 32 到 16384 (步长 32)     |
| `length`           | 24 fps 下的帧数；124 ≈ 5 秒，训练范围约为 124-362（默认：124）。                                                                                | INT    | 是  | 5 到 3600 (步长 17)       |
| `ref_image_size`   | 参考图像尺寸模式。`match` 仅在保持宽高比的情况下将每个参考图像缩放到生成画面的像素面积；`max` 使用参考管线的 2048 像素短边以获得最佳身份保真度。参考标记会贯穿每个采样步骤，因此 `max` 可能会慢数倍（默认：`match`）。 | COMBO  | 是  | `"match"`<br />`"max"` |
| `ref_images`       | 可选的参考图像。如果图像较大，则将每张图像缩小到短边 2048 像素，且绝不放大。可以提供多张图像。                                                                           | IMAGE  | 否  | 0 到 9                  |
| `ref_videos`       | 可选的参考视频帧，24 fps（2-15 秒）。可以提供多个视频。                                                                                            | IMAGE  | 否  | 0 到 3                  |
| `ref_video_audios` | 可选的配乐，按索引与参考视频配对；`ref_video_audio_N` 是与同编号 `ref_video_N` 对应的配乐。                                                              | AUDIO  | 否  | 0 到 3                  |
| `ref_audios`       | 可选的独立参考音频片段。                                                                                                                 | AUDIO  | 否  | 0 到 3                  |

注意：

* 提示词使用每种类型从 1 开始的标签引用参考媒体：`&lt;Picture i>` 用于图像，`&lt;Video k>` 用于视频，`&lt;Audio j>` 用于音频。参考内容以固定顺序提供给模型：先图像，再视频（每个配乐的 `&lt;Audio j>` 标签紧跟在其 `&lt;Video k>` 之前），然后是独立音频。
* 参考视频必须至少包含 5 帧（24 fps 下约 0.2 秒），否则节点会报错。视频帧数还会限制在所选 `length` 内，并裁剪到受支持的帧数。

## 输出

| 输出名称       | 描述                                                 | 数据类型         |
| ---------- | -------------------------------------------------- | ------------ |
| `positive` | 包含编码后的提示词以及 MiniMax H3 模型使用的编码后参考图像、视频和音频标记的条件化数据。 | CONDITIONING |
| `latent`   | 按请求的 `width`、`height` 和 `length`（帧数）生成的空音频-视频潜在表示。 | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/MiniMaxH3ReferenceToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `529e51c5c9c63a94176a15851f40ac42f7bd93e7d7c6ad334ed22aa29d04dfde`
