Skip to main content
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。
Gemma 4 是 Google DeepMind 的新一代轻量级开源 LLM 系列,专为文本生成、图像理解、视频分析、音频转录和结构化工具调用而设计。在 ComfyUI 中作为原生 文本生成(Text Generation) 模型提供原生支持。 模型亮点
  • 原生多模态 — 可同时接收文本、图像、视频和音频输入
  • 三种尺寸可选
    • E2B(2B) — 快速轻量,适合消费级 GPU
    • E4B(4B) — 性能均衡,推荐默认选择
    • 31B — 最佳质量,需要更高显存
  • 思考模式 — 内置逐步推理能力,生成答案前先进行逻辑推演
  • 长上下文 — 最高 128K tokens(E2B/E4B)和 256K tokens(31B)
  • 多语言 — 开箱支持 35+ 种语言,预训练覆盖 140+
  • 函数调用 — 原生支持结构化工具调用和 Agent 工作流
  • ComfyUI 原生支持 — 通过内置的 TextGenerateCLIPLoader 节点加载和使用
相关链接

可用工作流

Gemma 4:文本生成

输入你的文本提示词,并可选择附加图像、音频或视频。生成文本输出,具备可配置的推理、编程和多语言支持。 Gemma 4 文本生成工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Gemma 4:文本生成”
输入材料 将这些可选文件上传到对应的节点:

the_lily_veil.png

LoadImage 节点 2 · the_lily_veil.png

voice_demo.mp3

LoadAudio 节点 5 · voice_demo.mp3

video_wan_vace_inpainting_input_video.mp4

LoadVideo 节点 6 · video_wan_vace_inpainting_input_video.mp4
该工作流演示了 Gemma 4 的核心文本生成能力。它在接受文本提示词的同时,还可选择图像、音频或视频作为额外上下文,并生成自然语言输出,支持推理、编程和多语言提示。 输入
  • 文本提示词:你的问题或指令
  • 图像(可选):用于视觉理解任务(OCR、目标检测、图表阅读等)
  • 音频(可选):用于语音识别或转录
  • 视频(可选):用于跨帧视频理解(内部按 1 FPS 采样)
关键控制参数
  • Max length:生成的最大 token 数(默认 256)
  • Sampling mode:开关采样,并调整 temperature、top-k、top-p、重复惩罚和种子
  • Thinking mode:在最终答案之前启用逐步推理
  • Use default template:使用模型内置的系统提示词模板
输出
  • 已生成文本:模型以纯文本字符串形式返回的响应

了解 Subgraph

该工作流使用 Subgraph 节点实现模块化处理。查看 Subgraph 文档了解如何自定义和扩展工作流。

模型下载

Gemma 4 模型在 ComfyUI 中以文本编码器(text encoder)形式加载。下载对应的模型文件并放入正确的目录:

Gemma 4 2B (E2B IT FP8)

快速轻量,推荐消费级 GPU 使用。

Gemma 4 4B (E4B IT FP8)

性能均衡,工作流默认使用此模型。

查看所有变体

浏览所有 Gemma 4 模型权重。
将下载的 .safetensors 文件放入以下目录: