概述
Kandinsky 5.0 使用带有 Flow Matching 的潜在扩散管线,具有以下特点:- Diffusion Transformer (DiT): 主要的生成骨干网络,带有对文本嵌入的交叉注意力
- Qwen2.5-VL 和 CLIP: 提供高质量的文本嵌入
- HunyuanVideo 3D VAE: 将视频编码和解码到潜在空间
- SFT 模型: 最高的生成质量
- CFG-distilled: 推理速度提升 2 倍
- Diffusion-distilled: 速度提升 6 倍且质量损失最小(16 步)
- Pretrain 模型: 为微调而设计
模型变体
文生视频工作流
Kandinsky 5.0 Video Lite 文生视频
一个轻量级 2B 模型,可从英文和俄文提示词生成高视觉质量的视频。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”Kandinsky 5.0 Video Lite Text to Video”
2. 手动下载模型
文本编码器Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7B 文本编码器(FP8)。放入
ComfyUI/models/text_encoders/Text Encoder: clip_l.safetensors
CLIP-L 文本编码器。放入
ComfyUI/models/text_encoders/Diffusion Model: kandinsky5lite_t2v_sft_5s.safetensors
Kandinsky 5.0 T2V Lite SFT diffusion 模型(5s)。放入
ComfyUI/models/diffusion_models/VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE。放入
ComfyUI/models/vae/图生视频工作流
Kandinsky 5.0 Video Lite 图生视频
一个轻量级 2B 模型,可从英文和俄文提示词生成高视觉质量的视频。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”Kandinsky 5.0 Video Lite Image to Video”
LoadImage 节点:
crystal_flower.png
LoadImage 节点 11 · crystal_flower.png
2. 手动下载模型
文本编码器Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7B 文本编码器(FP8)。放入
ComfyUI/models/text_encoders/Text Encoder: clip_l.safetensors
CLIP-L 文本编码器。放入
ComfyUI/models/text_encoders/Diffusion Model: kandinsky5lite_i2v_5s.safetensors
Kandinsky 5.0 I2V Lite diffusion 模型(5s)。放入
ComfyUI/models/diffusion_models/VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE。放入
ComfyUI/models/vae/