このモデルには以下の 2 つのバージョンがあります:
- 14B(140 億パラメータ)
- 1.3B(13 億パラメータ)
テキストから動画への生成(T2V)や画像から動画への生成(I2V)など、複数のタスクに対応しています。
このモデルは既存のオープンソースモデルを性能面で上回るだけでなく、特に軽量版はわずか 8GB の VRAM で実行可能であり、導入ハードルを大幅に低減しています。
Wan2.1 ComfyUI ネイティブワークフローのサンプル
モデルのインストール
このガイドで言及されるすべてのモデルは、こちら から入手できます。以下は、このガイドの例で必要となる一般的なモデルで、事前にダウンロードできます: Text encoders からいずれか 1 つのバージョンを選択してダウンロードしてください:umt5_xxl_fp16.safetensors
FP16精度のテキストエンコーダー。
ComfyUI/models/text_encoders/ に配置してください。umt5_xxl_fp8_e4m3fn_scaled.safetensors
FP8スケーリング済みテキストエンコーダー。
ComfyUI/models/text_encoders/ に配置してください。wan_2.1_vae.safetensors
Wan2.1 VAE モデル。
ComfyUI/models/vae/ に配置してください。clip_vision_h.safetensors
画像条件付け用の CLIP Vision モデル。
ComfyUI/models/clip_vision/ に配置してください。diffusion モデルについては、このガイドでは fp16 精度のモデルを使用します。bf16 バージョンよりも性能が優れているためです。他の精度のバージョンが必要な場合は、こちら からダウンロードしてください。
Wan2.1 テキストから動画へのワークフロー (1.3B)
Wan 2.1 テキストから動画へ
Wan 2.1 を使用してテキストプロンプトからビデオを生成します。
Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで「Wan 2.1 Text to Video」を検索してください
モデルのダウンロード
wan2.1_t2v_1.3B_fp16.safetensors
Wan2.1 テキストから動画生成用の拡散モデルです。
ComfyUI/models/diffusion_models/ に配置してください。他の t2v 精度バージョンが必要な場合は、こちら からダウンロードしてください。
実行手順

Load Diffusion Modelノードがwan2.1_t2v_1.3B_fp16.safetensorsモデルを読み込んでいることを確認してください。Load CLIPノードがumt5_xxl_fp8_e4m3fn_scaled.safetensorsモデルを読み込んでいることを確認してください。Load VAEノードがwan_2.1_vae.safetensorsモデルを読み込んでいることを確認してください。- (任意) 必要に応じて、
EmptyHunyuanLatentVideoノードでビデオのサイズを変更できます。 - (任意) プロンプト(ポジティブとネガティブ)を変更する必要がある場合は、番号
5のCLIP Text Encoderノードで変更してください。 Runボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してビデオ生成を実行してください。
Wan2.1 画像から動画へのワークフロー(14B)
Wan Videoは480Pモデルと720Pモデルを分けているため、このガイドでは両方の解像度の例を紹介する必要があります。異なるモデルを使用するだけでなく、パラメータにもわずかな違いがあります。480Pバージョン
Wan 2.1 画像から動画へ
Wan 2.1を使用して画像からビデオを生成します。
Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
JSONをダウンロードするか、テンプレートライブラリで”Wan 2.1 Image to Video”を検索してください
LoadImageノードにこのファイルをアップロードしてください:
image_to_video_wan_start_image.png
LoadImageノード52 · image_to_video_wan_start_image.png
モデルのダウンロード
wan2.1_i2v_480p_14B_fp16.safetensors
Wan2.1 I2V 480P用の拡散モデル。
ComfyUI/models/diffusion_models/に配置してください。実行手順

Load Diffusion Modelノードがwan2.1_i2v_480p_14B_fp16.safetensorsモデルを読み込んでいることを確認してくださいLoad CLIPノードがumt5_xxl_fp8_e4m3fn_scaled.safetensorsモデルを読み込んでいることを確認してくださいLoad VAEノードがwan_2.1_vae.safetensorsモデルを読み込んでいることを確認してくださいLoad CLIP Visionノードがclip_vision_h.safetensorsモデルを読み込んでいることを確認してくださいLoad Imageノードに提供された入力画像をアップロードしてください- (任意)
CLIP Text Encoderノードに生成したいビデオの説明コンテンツを入力してください - (任意)必要に応じて
WanImageToVideoノードでビデオのサイズを変更できます Runボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してビデオ生成を実行してください
720Pバージョン
Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
ワークフロー画像をダウンロードしてComfyUIにドラッグすると、ワークフローを読み込めます
入力画像
デフォルトの入力画像をダウンロードするか、ご自身の画像を使用してください。
モデルのダウンロード
wan2.1_i2v_720p_14B_fp16.safetensors
Wan2.1 I2V 720P用の拡散モデル。
ComfyUI/models/diffusion_models/に配置してください。実行手順

Load Diffusion Modelノードがwan2.1_i2v_720p_14B_fp16.safetensorsモデルを読み込んでいることを確認してくださいLoad CLIPノードがumt5_xxl_fp8_e4m3fn_scaled.safetensorsモデルを読み込んでいることを確認してくださいLoad VAEノードがwan_2.1_vae.safetensorsモデルを読み込んでいることを確認してくださいLoad CLIP Visionノードがclip_vision_h.safetensorsモデルを読み込んでいることを確認してくださいLoad Imageノードに提供された入力画像をアップロードしてください- (任意)
CLIP Text Encoderノードに生成したいビデオの説明コンテンツを入力してください - (任意)必要に応じて
WanImageToVideoノードでビデオのサイズを変更できます Runボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してビデオ生成を実行してください