> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# Wan3ReferenceToVideoApi - ComfyUI Built-in Node Documentation

> 此节点使用 Wan 3.0 模型，根据文本提示词以及可选的参考图像、视频和音频生成视频。

此节点使用 Wan 3.0 模型，根据文本提示词以及可选的参考图像、视频和音频生成视频。参考媒体可以自由组合，并可在提示词中通过 @Image1、@Video1 和 @Audio1 引用。该节点将生成请求提交给 Wan API，并返回完成后的视频。

## 输入

### 通用输入

| 参数   | 描述                           | 数据类型           | 必需 | 范围                                       |
| ---- | ---------------------------- | -------------- | -- | ---------------------------------------- |
| `模型` | 选择用于生成的 Wan 3.0 模型变体。        | DYNAMIC\_COMBO | 是  | `wan3.0-video`<br />`wan3.0-video-prime` |
| `种子` | 用于生成的种子。默认值：42。              | INT            | 是  | 0 到 2147483647                           |
| `水印` | 是否在结果中添加 AI 生成的水印。默认值：false。 | BOOLEAN        | 是  | true<br />false                          |

### wan3.0-video 和 wan3.0-video-prime 输入

两个模型选项共享相同的参数集。

| 参数              | 描述                                                                                | 数据类型    | 必需 | 范围                                                                  |
| --------------- | --------------------------------------------------------------------------------- | ------- | -- | ------------------------------------------------------------------- |
| `prompt`        | 描述画面元素和视觉特征的提示词。支持英文和中文。以 @Image1、@Video1、@Audio1 引用已连接的参考媒体，按输入顺序每种类型单独编号。默认值：空。 | STRING  | 是  | 最多 20,000 个字符                                                       |
| `resolution`    | 输出视频的分辨率。                                                                         | COMBO   | 是  | "1080P"<br />"720P"<br />"480P"                                     |
| `ratio`         | 输出视频的宽高比。当设置为 "adaptive" 时，输出尺寸由输入媒体推导。                                           | COMBO   | 是  | "adaptive"<br />"16:9"<br />"9:16"<br />"1:1"<br />"4:3"<br />"3:4" |
| `duration`      | 输出时长（秒）。使用 "auto" 时，模型会选择适合提示词和参考媒体的时长。参考视频与输出的总时长不得超过 30 秒。                      | COMBO   | 是  | "auto"<br />"2" 到 "30"（整数秒）                                         |
| `audio`         | 输出视频是否包含音轨。默认值：true。                                                              | BOOLEAN | 是  | true<br />false                                                     |
| `prompt_extend` | 是否借助 AI 增强提示词。默认值：true。                                                           | BOOLEAN | 是  | true<br />false                                                     |

### 参考输入

| 参数                 | 描述                                                    | 数据类型  | 必需 | 范围          |
| ------------------ | ----------------------------------------------------- | ----- | -- | ----------- |
| `reference_images` | 可增长的槽位：连接 1 到 10 张参考图像。参考图像按输入顺序编号为 image1 到 image10。 | IMAGE | 否  | 0 到 10 张图像  |
| `reference_videos` | 可增长的槽位：连接 1 到 5 个参考视频。参考视频按输入顺序编号为 video1 到 video5。   | VIDEO | 否  | 0 到 5 个视频   |
| `reference_audios` | 可增长的槽位：连接 1 到 5 个参考音频片段。参考音频按输入顺序编号为 audio1 到 audio5。 | AUDIO | 否  | 0 到 5 个音频片段 |

**限制条件：**

* 提示词必须至少包含一个非空字符，或者至少连接一个参考图像、视频或音频输入。
* 提示词中的参考标签必须与已连接的输入匹配。例如，@Image1 指向第一个已连接的参考图像，@Video2 指向第二个已连接的参考视频，@Audio1 指向第一个已连接的参考音频。标签按输入顺序对每种类型分别编号。
* 每个已连接的参考图像必须恰好包含一张图像，而不是一个批次。
* 每个参考视频必须为 15 秒或更短。所有参考视频的总时长不得超过 15 秒。
* 每个参考音频必须为 15 秒或更短。所有参考音频的总时长不得超过 15 秒。
* 当 `duration` 不是 "auto" 时，所有参考视频的总时长加上所选输出时长不得超过 30 秒。

## 输出

| 输出名称    | 描述                            | 数据类型  |
| ------- | ----------------------------- | ----- |
| `video` | 生成的视频文件。当 `audio` 参数启用时，包含音轨。 | VIDEO |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/Wan3ReferenceToVideoApi/zh.md)

***

**Source fingerprint (SHA-256):** `09caa8142d71235417a3dfc5676c5f6accc2af1287fad3b7050844dd9453cc64`
