Skip to main content
Kandinsky 5.0 は、Kandinsky Lab が開発した動画および画像生成のための拡散モデルファミリーです。Kandinsky 5.0 T2V Lite は軽量な 2B パラメータモデルで、オープンソースの動画生成モデルのトップクラスに位置し、最大 10 秒の動画を生成できます。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

概要

Kandinsky 5.0 は、Flow Matching を備えた潜在拡散パイプラインを使用し、以下の特徴があります:
  • Diffusion Transformer (DiT): テキスト埋め込みへのクロスアテンションを備えた主要な生成バックボーン
  • Qwen2.5-VL と CLIP: 高品質なテキスト埋め込みを提供
  • HunyuanVideo 3D VAE: 動画を潜在空間にエンコードおよびデコード
このモデルファミリーには、さまざまなユースケースに最適化された複数のバリアントが含まれます:
  • SFT モデル: 最高の生成品質
  • CFG-distilled: 2倍高速な推論
  • Diffusion-distilled: 品質低下を最小限に抑えながら6倍高速(16ステップ)
  • Pretrain モデル: ファインチューニング用に設計
すべてのモデルは、5秒および10秒の動画生成バージョンで利用可能です。

モデルバリアント

テキストから動画へのワークフロー

Kandinsky 5.0 Video Lite テキストから動画へ

英語とロシア語のプロンプトから高い視覚品質で動画を生成する軽量な2Bモデルです。 Kandinsky 5.0 Video Lite Text to Video workflow preview

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで”Kandinsky 5.0 Video Lite Text to Video”を検索

2. モデルを手動でダウンロード

テキストエンコーダー

Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors

Qwen2.5-VL 7Bテキストエンコーダー(FP8)。ComfyUI/models/text_encoders/に配置

Text Encoder: clip_l.safetensors

CLIP-Lテキストエンコーダー。ComfyUI/models/text_encoders/に配置
Diffusion Model

Diffusion Model: kandinsky5lite_t2v_sft_5s.safetensors

Kandinsky 5.0 T2V Lite SFT diffusionモデル(5s)。ComfyUI/models/diffusion_models/に配置
VAE

VAE: hunyuan_video_vae_bf16.safetensors

HunyuanVideo 3D VAE。ComfyUI/models/vae/に配置

画像から動画へのワークフロー

Kandinsky 5.0 Video Lite 画像から動画へ

英語とロシア語のプロンプトから高い視覚品質で動画を生成する軽量な2Bモデルです。 Kandinsky 5.0 Video Lite Image to Video workflow preview

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで”Kandinsky 5.0 Video Lite Image to Video”を検索
入力素材 このファイルを対応するLoadImageノードにアップロードしてください:

crystal_flower.png

LoadImageノード 11 · crystal_flower.png
crystal_flower.png

2. モデルを手動でダウンロード

テキストエンコーダー

Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors

Qwen2.5-VL 7Bテキストエンコーダー(FP8)。ComfyUI/models/text_encoders/に配置

Text Encoder: clip_l.safetensors

CLIP-Lテキストエンコーダー。ComfyUI/models/text_encoders/に配置
Diffusion Model

Diffusion Model: kandinsky5lite_i2v_5s.safetensors

Kandinsky 5.0 I2V Lite diffusionモデル(5s)。ComfyUI/models/diffusion_models/に配置
VAE

VAE: hunyuan_video_vae_bf16.safetensors

HunyuanVideo 3D VAE。ComfyUI/models/vae/に配置

リソース