概要
Kandinsky 5.0 は、Flow Matching を備えた潜在拡散パイプラインを使用し、以下の特徴があります:- Diffusion Transformer (DiT): テキスト埋め込みへのクロスアテンションを備えた主要な生成バックボーン
- Qwen2.5-VL と CLIP: 高品質なテキスト埋め込みを提供
- HunyuanVideo 3D VAE: 動画を潜在空間にエンコードおよびデコード
- SFT モデル: 最高の生成品質
- CFG-distilled: 2倍高速な推論
- Diffusion-distilled: 品質低下を最小限に抑えながら6倍高速(16ステップ)
- Pretrain モデル: ファインチューニング用に設計
モデルバリアント
テキストから動画へのワークフロー
Kandinsky 5.0 Video Lite テキストから動画へ
英語とロシア語のプロンプトから高い視覚品質で動画を生成する軽量な2Bモデルです。
Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
JSONをダウンロードするか、テンプレートライブラリで”Kandinsky 5.0 Video Lite Text to Video”を検索
2. モデルを手動でダウンロード
テキストエンコーダーText Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7Bテキストエンコーダー(FP8)。
ComfyUI/models/text_encoders/に配置Text Encoder: clip_l.safetensors
CLIP-Lテキストエンコーダー。
ComfyUI/models/text_encoders/に配置Diffusion Model: kandinsky5lite_t2v_sft_5s.safetensors
Kandinsky 5.0 T2V Lite SFT diffusionモデル(5s)。
ComfyUI/models/diffusion_models/に配置VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE。
ComfyUI/models/vae/に配置画像から動画へのワークフロー
Kandinsky 5.0 Video Lite 画像から動画へ
英語とロシア語のプロンプトから高い視覚品質で動画を生成する軽量な2Bモデルです。
Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
JSONをダウンロードするか、テンプレートライブラリで”Kandinsky 5.0 Video Lite Image to Video”を検索
LoadImageノードにアップロードしてください:
crystal_flower.png
LoadImageノード 11 · crystal_flower.png
2. モデルを手動でダウンロード
テキストエンコーダーText Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7Bテキストエンコーダー(FP8)。
ComfyUI/models/text_encoders/に配置Text Encoder: clip_l.safetensors
CLIP-Lテキストエンコーダー。
ComfyUI/models/text_encoders/に配置Diffusion Model: kandinsky5lite_i2v_5s.safetensors
Kandinsky 5.0 I2V Lite diffusionモデル(5s)。
ComfyUI/models/diffusion_models/に配置VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE。
ComfyUI/models/vae/に配置