> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# GeminiVideoOmniV2 - ComfyUI Built-in Node Documentation

> Google Gemini Omni (Video) 使用 Google 的 Gemini Omni Flash 模型，根据文本提示生成带音频的视频。

Google Gemini Omni (Video) 使用 Google 的 Gemini Omni Flash 模型，根据文本提示生成带音频的视频。您可以选择附加参考图像和/或视频来引导生成结果或编辑现有素材。请在提示中直接描述所需时长（3-10 秒）。

## 输入

### 通用输入

| 参数      | 描述                   | 数据类型           | 必填 | 范围                                 |
| ------- | -------------------- | -------------- | -- | ---------------------------------- |
| `model` | 用于生成视频的 Gemini 视频模型。 | DYNAMIC\_COMBO | 是  | "Omni Flash 1.1"<br />"Omni Flash" |

### Omni Flash 1.1 输入

| 参数             | 描述                                                                                                                                                                                                             | 数据类型   | 必填 | 范围                                                                                                          |
| -------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------ | -- | ----------------------------------------------------------------------------------------------------------- |
| `prompt`       | 描述要生成的视频，或要对附加视频执行的编辑操作。请在提示中直接指定时长，例如“a 6-second clip”；对于“extend”任务，可写“extend by 5 seconds”。生成时长可为 3-10 秒，默认为 10 秒。输出包含音频。（默认：""）                                                                             | STRING | 是  | -                                                                                                           |
| `resolution`   | 输出分辨率。（默认：“720p”）                                                                                                                                                                                              | COMBO  | 是  | "360p"<br />"720p"<br />"1080p"<br />"4k"                                                                   |
| `aspect_ratio` | 输出宽高比：16:9（横屏）或 9:16（竖屏）。“edit”和“extend”任务会改为保持输入视频的宽高比。（默认：“16:9”）                                                                                                                                            | COMBO  | 是  | "16:9"<br />"9:16"                                                                                          |
| `task_type`    | 指定如何处理提示和附加媒体。使用“auto”时由模型自行决定。“text\_to\_video”仅根据提示生成，并拒绝附加媒体。“image\_to\_video”将一张图像制作成动画，或在附加两张图像时从起始帧插值到结束帧。“reference\_to\_video”将附加媒体视为主体参考。“edit”仅重写一段附加视频，“extend”将新片段追加到该视频，因此输出会以输入视频开头。（默认：“auto”） | COMBO  | 是  | "auto"<br />"text\_to\_video"<br />"image\_to\_video"<br />"reference\_to\_video"<br />"edit"<br />"extend" |
| `seed`         | seed 控制节点是否应重新运行；无论 seed 为何，结果均为非确定性。（默认：42）                                                                                                                                                                   | INT    | 是  | 0 到 2147483647                                                                                              |

### Omni Flash 输入

| 参数             | 描述                                                                                                                                                                             | 数据类型   | 必填 | 范围                                                                                            |
| -------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ | ------ | -- | --------------------------------------------------------------------------------------------- |
| `prompt`       | 描述要生成的视频，或要对附加视频执行的编辑操作。请在提示中直接指定时长，例如“a 6-second clip”；时长可为 3-10 秒。输出为 720p、24 FPS，带音频。（默认：""）                                                                                | STRING | 是  | -                                                                                             |
| `aspect_ratio` | 输出宽高比：16:9（横屏）或 9:16（竖屏）。“edit”任务会改为保持输入视频的宽高比。（默认：“16:9”）                                                                                                                     | COMBO  | 是  | "16:9"<br />"9:16"                                                                            |
| `task_type`    | 指定如何处理提示和附加媒体。使用“auto”时由模型自行决定。“text\_to\_video”仅根据提示生成，并拒绝附加媒体。“image\_to\_video”将一张图像制作成动画，或在附加两张图像时从起始帧插值到结束帧。“reference\_to\_video”将附加媒体视为主体参考。“edit”仅重写一段附加视频。（默认：“auto”） | COMBO  | 是  | "auto"<br />"text\_to\_video"<br />"image\_to\_video"<br />"reference\_to\_video"<br />"edit" |
| `temperature`  | 控制随机性。较低的值更聚焦/更确定，较高的值更多样。（默认：1.0）                                                                                                                                             | FLOAT  | 是  | 0.0 到 2.0 (step 0.01)                                                                         |
| `top_p`        | 核采样：从累积概率达到 top\_p 的最小 token 集合中采样。（默认：0.95）                                                                                                                                   | FLOAT  | 是  | 0.0 到 1.0 (step 0.01)                                                                         |
| `seed`         | seed 控制节点是否应重新运行；无论 seed 为何，结果均为非确定性。（默认：42）                                                                                                                                   | INT    | 是  | 0 到 2147483647                                                                                |

### 参考输入

| 参数       | 描述                                                                                                            | 数据类型  | 必填 | 范围            |
| -------- | ------------------------------------------------------------------------------------------------------------- | ----- | -- | ------------- |
| `images` | 可增长插槽：最多连接 14 张图像（`image_1`...`image_14`）。可选的参考图像，用于引导或生成视频动画。使用“image\_to\_video”任务时，第一张图像为起始帧，可选的第二张图像为结束帧。 | IMAGE | 否  | 0 到 14 images |
| `videos` | 可增长插槽：最多连接 3 个视频（`video_1`...`video_3`）。可选的参考视频，用于引导或编辑。每个视频最长 10 秒。                                          | VIDEO | 否  | 0 到 3 videos  |

**注意：**

* `prompt` 不能为空；如果为空，节点会报错。
* “text\_to\_video”任务仅根据提示生成——附加图像或视频会报错。
* “image\_to\_video”任务仅接受图像（不接受视频），且需要恰好 1 或 2 张图像：第一张为起始帧，可选的第二张为结束帧。
* “edit”任务（两种模型均支持）和“extend”任务（仅 Omni Flash 1.1 支持）需要恰好一个输入视频，并保持该输入视频的宽高比，从而覆盖 `aspect_ratio`。
* 最多可附加 14 张图像和 3 个视频，且每个附加视频的长度必须不超过 10 秒。
* Omni Flash 始终输出 720p、24 FPS 且带音频的视频；仅 Omni Flash 1.1 提供分辨率选择。
* `temperature` 和 `top_p` 控件仅适用于 Omni Flash 模型；Omni Flash 1.1 使用固定的生成设置。

## 输出

| 输出名称           | 描述                                                                               | 数据类型   |
| -------------- | -------------------------------------------------------------------------------- | ------ |
| `video`（第一个输出） | 生成的带音频视频。对于 Omni Flash：720p、24 FPS。对于 Omni Flash 1.1：使用在 `resolution` 输入中选择的分辨率。 | VIDEO  |
| `text`（第二个输出）  | 模型随视频生成的文本内容（可能为空）。                                                              | STRING |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/GeminiVideoOmniV2/zh.md)

***

**Source fingerprint (SHA-256):** `7a0dda4bcd662c9df3c680297ec9de7886d35e618de8b3ce0cd95b9afd13a892`
