Skip to main content
Qwen-Image 是阿里巴巴通义千问团队发布的首个图像生成基础模型,这是一个拥有 20B 参数的 MMDiT(多模态扩散变换器)模型,基于 Apache 2.0 许可证开源。该模型在复杂文本渲染精确图像编辑方面取得了显著进展,无论是英语还是中文等多种语言都能实现高保真输出。 模型亮点
  • 卓越的多语言文本渲染:支持英语、中文、韩语、日语等多种语言的高精度文本生成,保持字体细节和布局一致性
  • 多样化艺术风格:从照片级真实到印象派绘画,从动漫美学到极简设计,流畅适应各种创意提示
相关链接*: 另外目前 Qwen-Image 有多种 ControlNet 支持

ComfyOrg Qwen-Image live stream

Qwen-Image in ComfyUI - Lightning & LoRAs
Qwen-Image ControlNet in ComfyUI - DiffSynth

Qwen-Image 原生工作流示例

请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

Qwen-Image:文生图

使用 Qwen-Image 的 20B MMDiT 模型,以出色的多语言文本渲染和编辑能力生成图像。 Qwen-Image 文生图工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Qwen-Image”
示例输出 Qwen-Image 示例输出 本文档所附工作流中使用了三种不同的模型:
  1. Qwen-Image 原始模型 fp8_e4m3fn
  2. 8步加速版:Qwen-Image 原始模型 fp8_e4m3fn 与 lightx2v 8 步 LoRA
  3. 蒸馏版:Qwen-Image 蒸馏模型 fp8_e4m3fn
显存使用参考 GPU: RTX4090D 24GB

1. 工作流文件

更新 ComfyUI 后,你可以从模板中找到工作流文件,或者将下面的工作流拖入 ComfyUI 中加载。 Qwen-image 文生图工作流 蒸馏版

下载蒸馏版工作流

下载 JSON 工作流

2. 模型下载

ComfyUI 中可用的模型
  • Qwen-Image_bf16 (40.9 GB)
  • Qwen-Image_fp8 (20.4 GB)
  • 蒸馏版(非官方,仅需 15 步)
全部模型均可在 HuggingfaceModelScope 找到 Diffusion model Qwen_image_distill
  • 蒸馏版的原始作者建议使用 15 步和 cfg 1.0。
  • 根据测试,该蒸馏版在 10 步和 cfg 1.0 下也表现良好。你可以根据想要的图像类型选择 euler 或 res_multistep。
LoRA 文本编码器 VAE qwen_image_vae.safetensors 模型保存位置

3. 工作流使用说明

步骤图
  1. 确保 Load Diffusion Model 节点已加载 qwen_image_fp8_e4m3fn.safetensors
  2. 确保 Load CLIP 节点已加载 qwen_2.5_vl_7b_fp8_scaled.safetensors
  3. 确保 Load VAE 节点已加载 qwen_image_vae.safetensors
  4. 确保 EmptySD3LatentImage 节点已设置正确的图像尺寸
  5. CLIP Text Encoder 节点中设置提示词;目前至少支持英语、中文、韩语、日语、意大利语等。
  6. 如果要启用 lightx2v 的 8 步加速 LoRA,请选中该节点并使用 Ctrl + B 启用,然后按第 8 步中的说明修改 KSampler 设置。
  7. 点击 Queue 按钮,或使用快捷键 Ctrl(cmd) + Enter 运行工作流。
  8. 对于不同的模型版本和工作流,请相应调整 KSampler 参数。
蒸馏版模型和 lightx2v 的 8 步加速 LoRA 似乎无法同时使用。你可以尝试不同的组合,以验证它们是否可以一起使用。

Qwen Image InstantX ControlNet 工作流

这是一个 ControlNet 模型,因此你可以像使用普通 ControlNet 一样使用它。

Qwen-Image InstantX Union ControlNet

使用 Qwen-Image InstantX ControlNet 生成图像,支持 Canny、软边缘、深度和姿态。 Qwen-Image InstantX ControlNet 工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索”Qwen-Image InstantX ControlNet”
输入素材 将此文件上传到对应的 LoadImage 节点:

image_qwen_image_instantx_controlnet_input_image.jpg

LoadImage 节点 71 · image_qwen_image_instantx_controlnet_input_image.jpg
image_qwen_image_instantx_controlnet_input_image.jpg

1. 工作流和输入图像

2. 模型链接

  1. InstantX ControlNet
下载 Qwen-Image-InstantX-ControlNet-Union.safetensors 并将其保存到ComfyUI/models/controlnet/文件夹中
  1. Lotus Depth模型
我们将使用该模型来生成图像的深度图。需要下载以下两个模型: Diffusion模型 VAE模型
你还可以使用类似 comfyui_controlnet_aux 的自定义节点来生成深度图。

3. 工作流说明

流程说明
  1. 确保加载ControlNet模型节点正确加载了Qwen-Image-InstantX-ControlNet-Union.safetensors模型
  2. 上传输入图像
  3. 该子图使用Lotus Depth模型。你可以在模板中找到它,或编辑子图以了解更多信息,确保所有模型都已正确加载
  4. 点击运行按钮,或使用快捷键Ctrl(cmd) + Enter来运行工作流

Qwen Image ControlNet DiffSynth-ControlNets Model Patches 工作流

在 Comfy Cloud 上运行 这个模型实际上并不是一个 controlnet,而是一个 Model patch, 支持 canny、depth、inpaint 三种不同的控制模式 原始模型地址:DiffSynth-Studio/Qwen-Image ControlNet Comfy Org rehost 地址: Qwen-Image-DiffSynth-ControlNets/model_patches

1. 工作流及输入图片

下载下面的图片拖入 ComfyUI 中以加载对应的工作流 workflow

下载 JSON 格式工作流

下载下面的图片作为输入图片: input

2. 模型链接

其它模型与 Qwen-Image 基础工作流一致,你只需下载下面的模型并保存到 ComfyUI/models/model_patches 文件夹中

3. 工作流使用说明

目前 diffsynth 有三个 patch 的模型: Canny、Detph、Inpaint 三个模型 如果你是第一次使用 ControlNet 相关的工作流,你需要了解的是,用于控制的图片需要预处理成受支持的图像才可以被模型使用和识别 输入类型示意
  • Canny: 处理后的 canny , 线稿轮廓
  • Detph: 预处理后的深度图,体现空间关系
  • Inpaint: 需要用 Mask 标记需要重绘的部分
由于这个 patch 模型分为了三个不同的模型,所以你需要在输入时选择正确的预处理类型来保证图像的正确预处理 Canny 模型 ControlNet 使用说明 Canny 工作流
  1. 确保对应 qwen_image_canny_diffsynth_controlnet.safetensors 已被加载
  2. 上传输入图片,用于后续处理
  3. Canny 节点是原生的预处理节点,它将按照你设置的参数,将输入图像进行预处理,控制生成
  4. 如果需要可以修改 QwenImageDiffsynthControlnet 节点的 strength 强度来控制线稿控制的强度
  5. 点击 Run 按钮,或者使用快捷键 Ctrl(cmd) + Enter(回车) 来运行工作流
对于 qwen_image_depth_diffsynth_controlnet.safetensors 使用,需要将图像预处理成 depth 深度图,替换掉 image processing 图,对于这部分的使用,请参考本篇文档中 InstantX 的处理方法,其它部分与 Canny 模型的使用类似
Inpaint 模型 ControlNet 使用说明 Inpaint 工作流 对于 Inpaint 模型,它需要使用 蒙版编辑器,来绘制一个蒙版然后作为输入控制条件
  1. 确保 ModelPatchLoader 加载的是 qwen_image_inpaint_diffsynth_controlnet.safetensors 模型
  2. 上传图片,并使用蒙版编辑器 绘制蒙版,你需要将对应 Load Image节点的 mask 输出连接到 QwenImageDiffsynthControlnetmask 输入才能保证对应的蒙版被加载
  3. 使用 Ctrl-B 快捷键,将原本工作流中的 Canny 设置为绕过模式,来使得对应的 Canny 节点处理不生效
  4. CLIP Text Encoder 输入你需要将蒙版部分修改成样式
  5. 如需要可以修改 QwenImageDiffsynthControlnet 节点的 strength 强度来控制对应的控制强度
  6. 点击 Run 按钮,或者使用快捷键 Ctrl(cmd) + Enter(回车) 来运行工作流

Qwen Image Union ControlNet LoRA 工作流

Qwen-Image Union Control

使用 Qwen-Image 的统一 ControlNet LoRA 生成具有精确结构控制的图像。支持多种控制类型,包括 canny、depth、线稿、softedge、法线和 openpose。 Qwen-Image Union Control 工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Qwen-Image Union Control”
输入材料 将此文件上传到对应的 LoadImage 节点:

image_qwen_image_union_control_lora_input_image.png

LoadImage 节点 73 · image_qwen_image_union_control_lora_input_image.png
image_qwen_image_union_control_lora_input_image.png
示例输出
输入图像Qwen-Image Union Control 示例输出
原始模型地址:DiffSynth-Studio/Qwen-Image-In-Context-Control-Union Comfy Org 重新托管地址:qwen_image_union_diffsynth_lora.safetensors:支持 canny、depth、pose、线稿、softedge、法线、openpose 的图像结构控制 LoRA

1. 工作流及输入图像

更新 ComfyUI 之后,你可以从模板中找到工作流文件,或者将上方的工作流预览拖入 ComfyUI 中进行加载。

2. 模型链接

下载下面的模型。由于这是一个 LoRA 模型,需要保存到 ComfyUI/models/loras/ 文件夹下

3. 工作流说明

这个模型是一个统一控制 LoRA,支持 canny、depth、pose、线稿、softedge、法线、openpose 控制。由于许多图像预处理原生节点并未完全支持,你应该使用类似 comfyui_controlnet_aux 的工具来完成其他图像预处理。 Union Control LoRA
  1. 确保 LoraLoaderModelOnly 正确加载 qwen_image_union_diffsynth_lora.safetensors 模型
  2. 上传输入图像
  3. 如有需要,你可以调整 Canny 节点的参数。由于不同的输入图像需要不同的参数设置才能获得更好的图像预处理结果,你可以尝试调整相应的参数值,以获得更多/更少的细节
  4. 点击 Run 按钮,或使用快捷键 Ctrl(cmd) + Enter 运行工作流
对于其他类型的控制,你还需要替换图像处理部分。