> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMaxH3ReferenceToVideo - ComfyUI Built-in Node Documentation

> Complete documentation for the MiniMaxH3ReferenceToVideo node in ComfyUI. Learn its inputs, outputs, parameters and usage.

MiniMax H3 Reference to Video는 MiniMax H3 참조-영상 생성에 필요한 텍스트 컨디셔닝과 빈 영상 잠재(latent)를 생성합니다. 프롬프트와 선택적 참조 이미지, 영상, 오디오 클립을 제공하면 노드는 이러한 참조를 모델이 생성 중에 사용할 수 있는 토큰으로 인코딩합니다. 프롬프트는 `&lt;Picture i>`, `&lt;Video k>`, `&lt;Audio j>` 태그로 참조를 지정합니다.

## 입력

| 매개변수               | 설명                                                                                                                                                                                           | 데이터 타입 | 필수  | 범위                     |
| ------------------ | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------ | --- | ---------------------- |
| `clip`             | 프롬프트를 토큰화하고 참조 미디어를 컨디셔닝 토큰으로 인코딩하는 데 사용되는 CLIP 모델입니다.                                                                                                                                       | CLIP   | 예   |                        |
| `vae`              | 참조 이미지와 참조 비디오 프레임을 잠재 공간으로 인코딩하는 데 사용되는 VAE입니다.                                                                                                                                             | VAE    | 예   |                        |
| `audio_vae`        | 참조 오디오를 잠재 공간으로 인코딩하는 데 사용되는 VAE입니다(32kHz 오디오 샘플 레이트).                                                                                                                                       | VAE    | 예   |                        |
| `prompt`           | 비디오에 대한 텍스트 프롬프트입니다. 참조 미디어는 `&lt;Picture i>`, `&lt;Video k>`, `&lt;Audio j>` 태그(각 유형별 1부터 시작)로 지정할 수 있습니다. 여러 줄 및 동적 프롬프트를 지원합니다.                                                           | STRING | 예   |                        |
| `width`            | 생성된 비디오의 너비(픽셀)입니다(기본값: 1344).                                                                                                                                                               | INT    | 예   | 32 \~ 16384 (단계 32)    |
| `height`           | 생성된 비디오의 높이(픽셀)입니다(기본값: 768).                                                                                                                                                                | INT    | 예   | 32 \~ 16384 (단계 32)    |
| `length`           | 24fps에서의 프레임 수입니다. 124 = 약 5초, 학습 범위는 약 124\~362입니다(기본값: 124).                                                                                                                               | INT    | 예   | 5 \~ 3600 (단계 17)      |
| `ref_image_size`   | 참조 이미지 크기 조정 모드입니다. `match`는 각 참조 이미지를 종횡비를 유지하면서 생성 픽셀 영역에 맞게 축소만 합니다. `max`는 참조 파이프라인의 2048px 짧은 변을 사용하여 최상의 동일성 충실도를 제공합니다. 참조 토큰은 모든 샘플링 단계를 통과하므로 `max`는 몇 배 더 느릴 수 있습니다(기본값: `match`). | COMBO  | 예   | `"match"`<br />`"max"` |
| `ref_images`       | 선택적 참조 이미지입니다. 각 이미지는 더 큰 경우 2048px 짧은 변으로 축소되며 확대되지 않습니다. 여러 이미지를 제공할 수 있습니다.                                                                                                               | IMAGE  | 아니요 | 0 \~ 9                 |
| `ref_videos`       | 선택적 참조 비디오 프레임입니다(24fps, 2\~15초). 여러 비디오를 제공할 수 있습니다.                                                                                                                                        | IMAGE  | 아니요 | 0 \~ 3                 |
| `ref_video_audios` | 참조 비디오와 인덱스로 짝지어진 선택적 사운드트랙입니다. `ref_video_audio_N`은 같은 번호의 `ref_video_N`의 사운드트랙입니다.                                                                                                         | AUDIO  | 아니요 | 0 \~ 3                 |
| `ref_audios`       | 선택적 독립 실행형 참조 오디오 클립입니다.                                                                                                                                                                     | AUDIO  | 아니요 | 0 \~ 3                 |

참고:

* 프롬프트는 각 유형별 1부터 시작하는 태그로 참조 미디어를 지정합니다: 이미지에는 `&lt;Picture i>`, 비디오에는 `&lt;Video k>`, 오디오에는 `&lt;Audio j>`를 사용합니다. 참조는 고정된 순서로 모델에 제공됩니다: 이미지, 그 다음 비디오(각 사운드트랙의 `&lt;Audio j>` 라벨은 해당 `&lt;Video k>` 바로 앞에 위치), 그 다음 독립 실행형 오디오입니다.
* 참조 비디오는 최소 5프레임(24fps에서 약 0.2초)을 포함해야 하며, 그렇지 않으면 노드가 오류를 발생시킵니다. 비디오 프레임은 또한 선택된 `length`로 제한되고 지원되는 프레임 수로 잘립니다.

## 출력

| 출력 이름      | 설명                                                                       | 데이터 타입       |
| ---------- | ------------------------------------------------------------------------ | ------------ |
| `positive` | MiniMax H3 모델에서 사용하는 인코딩된 프롬프트와 인코딩된 참조 이미지, 비디오 및 오디오 토큰을 포함하는 컨디셔닝입니다. | CONDITIONING |
| `latent`   | 요청된 `width`, `height`, `length`(프레임 수)의 빈 오디오-비디오 잠재(latent)입니다.         | LATENT       |

> 이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! [GitHub에서 편집](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/MiniMaxH3ReferenceToVideo/ko.md)

***

**Source fingerprint (SHA-256):** `529e51c5c9c63a94176a15851f40ac42f7bd93e7d7c6ad334ed22aa29d04dfde`
