Skip to main content
vertexai/gemini-nano-banana-2.1 的 API 参考,由 Comfy Router 从 Google 提供。 输入: 文本、图像、视频 · 输出: 图像 + 文本

快速开始

在你的 Comfy 工作区中创建密钥,并将其导出为 COMFY_API_KEY。Python 和 TypeScript 代码片段使用 Comfy SDK(pip install comfy-sdk 和 npm install @comfyorg/sdk);cURL 代码片段则是通过原始 HTTP 发出的同一调用。 模型 ID: vertexai/gemini-nano-banana-2.1 端点: POST https://api.comfy.org/v2/models/vertexai/gemini-nano-banana-2.1
相同的请求体,发送到 POST https://api.comfy.org/v2/models/vertexai/gemini-nano-banana-2.1/requests。一旦运行被接纳,Router 便会返回 201 和 request_id,结果准备就绪后即可收集,可以从当前进程或另一个进程收集。队列投递介绍了状态、取消和结果收集。

Schema

输入

object[]
必填
与模型当前对话的内容。对于单轮查询,这是一个单独实例。对于多轮查询,这是一个重复字段,包含对话历史和最新请求。
object[]
必填
object
基于 URI 的数据。
string
URI
string
在 data 或 fileUri 字段中指定的文件的媒体类型。可接受的值包括以下这些。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(不含音频)的最大长度为一小时。有关更多信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容计入 token 上限。图像分辨率无限制。可选值: application/pdf, audio/mpeg, audio/mp3, audio/wav, image/png, image/jpeg, image/webp, text/plain, video/mov, video/mpeg, video/mp4, video/mpg, video/avi, video/wmv, video/mpegps, video/flv, image/heic, image/heif, audio/flac, video/webm
object
以原始字节形式提供的内联数据。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,通过 inlineData 最多可以指定 3000 张图像。
string (byte)
内联包含在提示中的图像、PDF 或视频的 base64 编码。以内联方式包含媒体时,还必须指定该数据的媒体类型(mimeType)。大小限制:20MB格式: byte
string
在 data 或 fileUri 字段中指定的文件的媒体类型。可接受的值包括以下这些。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(不含音频)的最大长度为一小时。有关更多信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容计入 token 上限。图像分辨率无限制。可选值: application/pdf, audio/mpeg, audio/mp3, audio/wav, image/png, image/jpeg, image/webp, text/plain, video/mov, video/mpeg, video/mp4, video/mpg, video/avi, video/wmv, video/mpegps, video/flv, image/heic, image/heif, audio/flac, video/webm
string
模型如何读取此部分的视频。设置为 “AGENTIC” 可让模型自行决定要检查哪些片段,而不是使用固定帧率的采样。省略则使用默认的固定帧率采样。gemini-3.7-flash 及更新的 Flash 模型支持此功能。
string
文本提示或代码片段。
boolean
表示此部分是来自模型的一个思考/推理步骤。
string
可选值: user, model
object
生成的采样、长度和输出设置。每个字段都是可选的:下面声明了 default 的字段在省略时会应用该默认值,其余字段则回退到模型自身的行为。
object
图像生成的配置
string
已生成图像的宽高比
object
可选。已生成图像的图像输出格式。
integer
可选。输出图像的压缩质量。
string
可选。在 Vertex AI 路径上,输出应保存为的图像格式:即由 Comfy 自有凭据提供的请求,以及使用 GCP 服务账号进行身份验证的 BYOK 请求。这些路径上可接受的值为 image/png 和 image/jpeg,匹配时不区分大小写,并在请求转发之前规范化为小写;任何其他值都会被拒绝,并返回指出此字段的 400 错误。省略时默认为 image/png。使用 Google AI Studio API 密钥进行身份验证的 BYOK 请求是例外:该上游没有此属性,若该属性存在会拒绝整个调用,因此该字段会从请求中移除,而不是被采纳或拒绝,输出格式则为 AI Studio 所选择的格式。在所有路径上,都应从返回给你的响应部分中读回媒体类型(inlineData.mimeType,或者当设置了 uploadImagesToStorage 时读取 fileData.mimeType),而不要假定你发送的值。
string
可选。指定已生成图像的尺寸。支持的值为 1K、2K、4K。如果未指定,模型将使用默认值 1K。
integer
响应中可生成的最大 token 数。一个 token 大约相当于 4 个字符。100 个 token 大致对应 60 至 80 个单词。范围: 16 到 65536
`TEXT`, `IMAGE`[]
integer
当种子固定为特定值时,模型会尽最大努力对重复请求给出相同的响应。无法保证输出具有确定性。此外,即使使用相同的种子值,更改模型或参数设置(例如 temperature)也可能导致响应出现变化。默认情况下会使用随机种子值。适用于以下模型:gemini-2.5-flash、gemini-2.5-pro、gemini-2.5-flash-preview-04-1、gemini-2.5-pro-preview-05-0、gemini-2.0-flash-lite-00、gemini-2.0-flash-001
string[]
number
默认值:"1"
temperature 用于在响应生成过程中进行采样,采样发生在应用 topP 和 topK 时。temperature 控制 token 选择过程中的随机程度。较低的温度适合需要不太开放或不太有创意响应的提示词,而较高的温度可以带来更多样或更有创意的结果。温度为 0 表示始终选择概率最高的 token。在这种情况下,给定提示词的响应基本是确定性的,但仍可能出现少量变化。如果模型返回的响应过于笼统、过于简短,或者模型给出了回退响应,请尝试提高 temperature范围:0 到 2格式:float
object
可选。思考功能的配置。思考是模型将复杂任务分解为更小步骤,以生成更高质量响应的过程。
boolean
可选。如果为 true,模型会在响应中包含其思考内容。
integer
可选。模型思考过程的 token 预算。模型会尽最大努力保持在该预算范围内。
string
可选。模型的思考级别。可能的值:THINKING_LEVEL_UNSPECIFIED、LOW、MEDIUM、HIGH、MINIMAL
integer
默认值:"40"
Top-K 会改变模型为输出选择 token 的方式。top-K 为 1 表示下一个被选择的 token 是模型词表中所有 token 里概率最高的那个。top-K 为 3 表示下一个 token 会借助 temperature 从概率最高的 3 个 token 中选出。范围:1 到 …
number
默认值:"0.95"
如果指定,则使用核采样。 Top-P 会改变模型为输出选择 token 的方式。token 会从概率最高(参见 top-K)到概率最低依次被选中,直到它们的概率之和等于 top-P 值。例如,如果 token A、B 和 C 的概率分别为 0.3、0.2 和 0.1,而 top-P 值为 0.5,那么模型会借助 temperature 选择 A 或 B 作为下一个 token,并将 C 排除在候选之外。 指定较低的值可获得随机性更低的响应,指定较高的值可获得随机性更高的响应。范围:0 到 1格式:float
object[]
用于阻止不安全内容的按请求设置。在 GenerateContentResponse.candidates 上强制执行。
string
必填
可能的值:HARM_CATEGORY_SEXUALLY_EXPLICIT、HARM_CATEGORY_HATE_SPEECH、HARM_CATEGORY_HARASSMENT、HARM_CATEGORY_DANGEROUS_CONTENT
string
必填
可能的值:OFF、BLOCK_NONE、BLOCK_LOW_AND_ABOVE、BLOCK_MEDIUM_AND_ABOVE、BLOCK_ONLY_HIGH
object
用于引导模型以获得更好表现的指令。例如,“尽可能简洁地回答” 或 “在回复中不要使用技术术语”。文本字符串会计入 token 限制。systemInstruction 的 role 字段会被忽略,不会影响模型的表现。注意:parts 中只应使用文本,且每个 part 中的内容应位于单独的段落中。
object[]
必填
构成单条消息的有序 parts 列表。不同的 part 可以具有不同的 IANA MIME 类型。关于输入的限额,例如最大 token 数或图像数量,请参阅 Google 模型页面上的模型规格。
string
文本提示词或代码片段。
string
创建消息的实体的身份。支持以下值:user:表示消息由真人发送,通常是用户生成的消息。model:表示消息由模型生成。在多轮对话期间,使用 model 值将来自模型的消息插入对话中。对于非多轮对话,该字段可以留空或不设置。可能的值:user、model
object[]
一段代码,使系统能够与外部系统交互,以执行模型知识和范围之外的一个或多个操作。参见函数调用。
object[]
string
string
必填
object
函数参数的 JSON schema
boolean
如果为是,已生成的图像将上传到云端存储,并以签名 URL 的形式返回,而不是以内联 base64 数据返回。这些 URL 会在 24 小时后过期。
object
对于视频输入,表示视频的起始和结束偏移量,采用 Duration 格式。例如要指定从 1:00 开始的 10 秒片段,请设置 “startOffset”: { “seconds”: 60 } 和 “endOffset”: { “seconds”: 70 }。仅当视频数据以 inlineData 或 fileData 形式提供时,才应指定该元数据。
object
表示视频时间线位置的一个时长偏移量。
integer
以纳秒分辨率表示的有符号秒的小数部分。带有小数部分的负秒值,其 nanos 值仍必须为非负数。范围:0 到 999999999
integer
时间段的有符号秒数。必须介于 -315,576,000,000 到 +315,576,000,000(含两端)之间。范围:-315576000000 到 315576000000
object
表示视频时间线位置的一个时长偏移量。
integer
以纳秒分辨率表示的有符号秒的小数部分。带有小数部分的负秒值,其 nanos 值仍必须为非负数。范围:0 到 999999999
integer
时间段的有符号秒数。必须介于 -315,576,000,000 到 +315,576,000,000(含两端)之间。范围:-315576000000 到 315576000000
本内容由 Router 在 GET /v2/models/vertexai/gemini-nano-banana-2.1/openapi.json 提供的 schema 生成,与请求到达提供商之前用于校验调用的文档相同。

输出

object[]
object
object[]
string[]
integer
string
string (date)
格式:date
integer
string
string
object
与模型当前对话的内容。对于单轮查询,这是一个单一实例。对于多轮查询,这是一个重复字段,包含对话历史记录和最新请求。
object[]
必填
object
基于 URI 的数据。
string
URI
string
data 或 fileUri 字段中所指定文件的媒体类型。可接受的值包括以下内容。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(不含音频)的最大长度为一小时。有关更多信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容会计入 token 限制。图像分辨率无限制。Possible values: application/pdf, audio/mpeg, audio/mp3, audio/wav, image/png, image/jpeg, image/webp, text/plain, video/mov, video/mpeg, video/mp4, video/mpg, video/avi, video/wmv, video/mpegps, video/flv, image/heic, image/heif, audio/flac, video/webm
object
以原始字节表示的内联数据。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,使用 inlineData 最多可以指定 3000 张图像。
string (byte)
要在提示中内联包含的图像、PDF 或视频的 base64 编码。以内联方式包含媒体时,还必须指定数据的媒体类型(mimeType)。大小限制:20MB格式:byte
string
data 或 fileUri 字段中所指定文件的媒体类型。可接受的值包括以下内容。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(不含音频)的最大长度为一小时。有关更多信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容会计入 token 限制。图像分辨率无限制。Possible values: application/pdf, audio/mpeg, audio/mp3, audio/wav, image/png, image/jpeg, image/webp, text/plain, video/mov, video/mpeg, video/mp4, video/mpg, video/avi, video/wmv, video/mpegps, video/flv, image/heic, image/heif, audio/flac, video/webm
string
模型如何读取此部分的视频。设置为 “AGENTIC” 可让模型自行决定要检查哪些片段,而不是采用固定帧率采样。省略则使用默认的固定帧率采样。支持 gemini-3.7-flash 及更新的 Flash 模型。
string
文本提示或代码片段。
boolean
表示此部分是模型的思考/推理步骤。
string
Possible values: user, model
string
object[]
string
Possible values: HARM_CATEGORY_SEXUALLY_EXPLICIT, HARM_CATEGORY_HATE_SPEECH, HARM_CATEGORY_HARASSMENT, HARM_CATEGORY_DANGEROUS_CONTENT
string
内容违反所指定安全类别的概率Possible values: NEGLIGIBLE, LOW, MEDIUM, HIGH, UNKNOWN
string
响应创建时的时间戳。
string
用于生成响应的模型版本。
object
string
string
object[]
string
Possible values:HARM_CATEGORY_SEXUALLY_EXPLICIT、HARM_CATEGORY_HATE_SPEECH、HARM_CATEGORY_HARASSMENT、HARM_CATEGORY_DANGEROUS_CONTENT
string
内容违反指定安全类别的概率Possible values:NEGLIGIBLE、LOW、MEDIUM、HIGH、UNKNOWN
string
响应的唯一标识符。
object
integer
仅输出。输入中缓存部分(即缓存内容)的 token 数量。
integer
响应中的 token 数量。
object[]
按模态划分的候选 token 明细。
string
输入或输出内容的模态类型。Possible values:MODALITY_UNSPECIFIED、TEXT、IMAGE、VIDEO、AUDIO、DOCUMENT
integer
指定模态的 token 数量。
integer
请求中的 token 数量。设置 cachedContent 后,该值仍表示提示的总有效大小,也就是说其中包含缓存内容中的 token 数量。
object[]
按模态划分的提示 token 明细。
string
输入或输出内容的模态类型。Possible values:MODALITY_UNSPECIFIED、TEXT、IMAGE、VIDEO、AUDIO、DOCUMENT
integer
指定模态的 token 数量。
integer
思维输出中的 token 数量。
integer
工具使用提示中的 token 数量。
object[]
按模态划分的工具使用提示 token 明细。
string
输入或输出内容的模态类型。Possible values:MODALITY_UNSPECIFIED、TEXT、IMAGE、VIDEO、AUDIO、DOCUMENT
integer
指定模态的 token 数量。
integer
token 总数(提示 + 候选)。
string
用于该请求的流量类型(例如 PROVISIONED_THROUGHPUT)。

示例

输入

输出

发布前须知

SDK 会生成 Idempotency-Key 并在自动重试中复用它。手动重试时,请复用原始 key。Router 最长可保持连接 10 分钟。 请求失败时,Router 会发送 X-Comfy-Error-Type 响应头说明原因。422 表示 Router 在调用提供商之前就拒绝了输入,413 表示请求体超出了 Router 可接受的大小。已生成的资源请及时下载,因为结果 URL 会过期。 上文任何字段描述中提到的尺寸限制,都是提供商对该字段自身的限定,引自提供商的规范。Router 会对整个请求体另行设置上限,base64 编码的媒体内容也计入其中:参见请求体大小。 本页记录的是通过 Comfy Router 调用的某一个合作伙伴模型。同一个 comfy-sdk / @comfyorg/sdk 包还提供第二个客户端,用于在 Comfy Cloud 上运行完整的 ComfyUI 工作流图:Comfy(api_key=...) / new Comfy({ apiKey }),并带有 client.workflows、client.assets 和 client.jobs。请参阅 Comfy SDKs。

请求头

身份验证、幂等性、请求 ID、错误分类、重试节奏、消费限额。

使用 Router API

模型发现、验证错误、重试与计费。

限制

Router 目前不支持的功能,以及替代方案。