Overview
Kandinsky 5.0 uses a latent diffusion pipeline with Flow Matching and features:- Diffusion Transformer (DiT): Main generative backbone with cross-attention to text embeddings
- Qwen2.5-VL and CLIP: Provides high-quality text embeddings
- HunyuanVideo 3D VAE: Encodes and decodes video into a latent space
- SFT model: Highest generation quality
- CFG-distilled: 2× faster inference
- Diffusion-distilled: 6× faster with minimal quality loss (16 steps)
- Pretrain model: Designed for fine-tuning
Model variants
Text-to-Video workflow
Kandinsky 5.0 Video Lite Text to Video
A lightweight 2B model that generates videos from English and Russian prompts with high visual quality.
Run on Comfy Cloud
Open in Comfy Cloud
Download Workflow
Download JSON or search “Kandinsky 5.0 Video Lite Text to Video” in Template Library
2. Manually download models
Text EncodersText Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7B text encoder (FP8). Place in
ComfyUI/models/text_encoders/Text Encoder: clip_l.safetensors
CLIP-L text encoder. Place in
ComfyUI/models/text_encoders/Diffusion Model: kandinsky5lite_t2v_sft_5s.safetensors
Kandinsky 5.0 T2V Lite SFT diffusion model (5s). Place in
ComfyUI/models/diffusion_models/VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE. Place in
ComfyUI/models/vae/Image-to-Video workflow
Kandinsky 5.0 Video Lite Image to Video
A lightweight 2B model that generates videos from English and Russian prompts with high visual quality.
Run on Comfy Cloud
Open in Comfy Cloud
Download Workflow
Download JSON or search “Kandinsky 5.0 Video Lite Image to Video” in Template Library
LoadImage node:
crystal_flower.png
LoadImage node 11 · crystal_flower.png
2. Manually download models
Text EncodersText Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7B text encoder (FP8). Place in
ComfyUI/models/text_encoders/Text Encoder: clip_l.safetensors
CLIP-L text encoder. Place in
ComfyUI/models/text_encoders/Diffusion Model: kandinsky5lite_i2v_5s.safetensors
Kandinsky 5.0 I2V Lite diffusion model (5s). Place in
ComfyUI/models/diffusion_models/VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE. Place in
ComfyUI/models/vae/