ユーザーは開始フレームと終了フレームの2枚の画像のみを提供すれば、モデルが自動的に中間の遷移フレームを生成し、論理的かつ自然な流れを持つ720p高精細動画を出力します。 主な技術的特長
- 高精度な始終フレーム制御:始終フレームの一致率は98%に達し、開始・終了シーンによって動画の境界を定義し、中間の動的変化を知的に補完することで、シーン遷移やオブジェクトの形態変化などの効果を実現します。
- 安定・滑らかな動画生成:CLIPのセマンティック特徴およびクロスアテンション機構を活用し、同様のモデルと比較して動画のジャッター率を37%低減。自然で滑らかな遷移を保証します。
- 多機能なクリエイティブ能力:中国語・英語字幕の動的埋め込み、アニメ/リアル/ファンタジーなど複数スタイルの生成に対応し、さまざまなクリエイティブニーズに応えます。
- 720p高精細出力:後処理を必要とせず、直接1280×720解像度の動画を生成。SNSや商用用途に最適です。
- オープンソースエコシステム対応:モデル重み、ソースコード、訓練フレームワークがすべてオープンソース化されており、主要なAIプラットフォームへのデプロイをサポートします。
- DiTアーキテクチャ:拡散モデルおよびDiffusion Transformerアーキテクチャに基づき、Full Attention機構を組み合わせて時空間依存性のモデリングを最適化し、動画の一貫性を確保します。
- 3D因果的変分エンコーダ:Wan-VAE技術により、高精細フレームを1/128サイズに圧縮しつつ、微細な動的ディテールを保持。メモリ使用量を大幅に削減します。
- 3段階トレーニング戦略:480P解像度での事前学習から始め、段階的に720Pへとアップグレード。フェーズごとの最適化により、生成品質と計算効率のバランスを図ります。
- GitHubリポジトリ: GitHub
- Hugging Faceモデルページ: Hugging Face
- ModelScopeコミュニティ: ModelScope
Wan2.1 FLF2V 720P ComfyUIネイティブワークフロー例
1. ワークフローファイルおよび関連入力ファイルのダウンロード
ComfyUIを最新バージョンにアップデートしてから、ワークフローファイルをダウンロードしてComfyUIにドラッグ&ドロップするか、Workflow → Browse Templates → Video のテンプレートライブラリから「Wan2.1 FLF2V 720P」を検索してください。
Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
JSONをダウンロードするか、テンプレートライブラリで「Wan2.1 FLF2V」を検索してください
開始画像: wan2.1_flf2v_720_f16_start_image.png
動画生成の開始フレーム(LoadImageノード52)。この画像をダウンロードして使用するか、ご自身の画像に置き換えてください。
終了画像: wan2.1_flf2v_720_f16_end_image.png
動画生成の終了フレーム(LoadImageノード72)。この画像をダウンロードして使用するか、ご自身の画像に置き換えてください。
2. 手動によるモデルインストール
本ガイドで使用するすべてのモデルは、こちらから入手できます。 Diffusion Models:ご使用のハードウェアに応じて、いずれかのバージョンを選択してください。拡散モデル: Wan2.1 FLF2V 14B FP16
wan2.1_flf2v_720p_14B_fp16.safetensors : フル精度、より多くのVRAMが必要。
ComfyUI/models/diffusion_models/に配置してください。拡散モデル: Wan2.1 FLF2V 14B FP8
wan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensors : 量子化版、VRAM使用量が少ない。
ComfyUI/models/diffusion_models/に配置してください。テキストエンコーダ: UMT5 XXL FP16
umt5_xxl_fp16.safetensors : フル精度のテキストエンコーダ。
ComfyUI/models/text_encoders/に配置してください。テキストエンコーダ: UMT5 XXL FP8
umt5_xxl_fp8_e4m3fn_scaled.safetensors : 量子化版テキストエンコーダ。
ComfyUI/models/text_encoders/に配置してください。VAE: Wan2.1 VAE
wan_2.1_vae.safetensors : Wan2.1 VAE(エンコード/デコード用)。
ComfyUI/models/vae/に配置してください。CLIP Vision: CLIP Vision H
clip_vision_h.safetensors : CLIP Visionエンコーダ。
ComfyUI/models/clip_vision/に配置してください。3. ワークフロー実行手順(ステップ・バイ・ステップ)

Load Diffusion Modelノードがwan2.1_flf2v_720p_14B_fp16.safetensorsまたはwan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensorsを正しく読み込んでいることを確認してください。Load CLIPノードがumt5_xxl_fp8_e4m3fn_scaled.safetensorsを正しく読み込んでいることを確認してください。Load VAEノードがwan_2.1_vae.safetensorsを正しく読み込んでいることを確認してください。Load CLIP Visionノードがclip_vision_h.safetensorsを正しく読み込んでいることを確認してください。- 開始フレーム画像を
Start_imageノードにアップロードしてください。 - 終了フレーム画像を
End_imageノードにアップロードしてください。 - (任意)ポジティブプロンプトおよびネガティブプロンプトを編集できます(中国語および英語の両方がサポートされています)。
- (重要)
WanFirstLastFrameToVideoノードでは、デフォルトで720×1280のサイズが使用されています。これは720Pモデルであるため、小さいサイズでは良好な出力が得られません。高品質な生成を行うには、720×1280に近いサイズをご使用ください。 Runボタンをクリックするか、ショートカットキーCtrl(Macの場合はCmd) + Enterを押して動画生成を実行してください。