Skip to main content

Wan2.1-Fun-Control について

Wan2.1-Fun-Control は、アリババチームによって開発されたオープンソースの動画生成・制御プロジェクトです。 革新的な制御コード(Control Codes)メカニズムを導入し、深層学習とマルチモーダル条件入力を組み合わせることで、事前設定された制御条件に準拠した高品質な動画を生成します。このプロジェクトは、マルチモーダル制御条件を通じて生成される動画コンテンツを正確に誘導することに焦点を当てています。 現在、Fun Control モデルはCanny(線画)、Depth、OpenPose(人体姿勢)、MLSD(幾何エッジ)、軌道制御を含むさまざまな制御条件をサポートしています。 また、モデルは16フレーム/秒で512、768、1024の解像度オプションを持つ多解像度動画予測をサポートし、最大81フレーム(約5秒)の長さの動画を生成できます。 モデルバージョン:
  • 1.3B 軽量版:ローカルデプロイメントと高速推論に適しており、VRAM要件が低い
  • 14B 高性能版:モデルサイズは32GB+に達し、より良い結果を提供しますが、より高いVRAMが必要
モデルウェイトのダウンロード

Wan2.1-Fun-1.3B-Control

軽量版、VRAM要件が低い

Wan2.1-Fun-14B-Control

高性能版、ファイルサイズ32GB以上、VRAM要件が高い
コードリポジトリVideoX-Fun ComfyUIは現在、Wan2.1 Fun Control モデルをネイティブサポートしています。このチュートリアルを開始する前に、このコミット 以降のバージョンを使用していることを確認するために、ComfyUIを更新してください。 本ガイドでは、2つのワークフローを提供します:
  1. ネイティブのComfy Coreノードのみを使用するワークフロー
  2. カスタムノードを使用するワークフロー
現在のネイティブノードの動画サポートの制限により、ネイティブのみのワークフローは、ユーザーがカスタムノードをインストールせずにプロセスを完了できるように保証します。 ただし、動画生成の良いユーザー体験を提供することは、カスタムノードなしでは困難であることがわかっているため、本ガイドでは両方のワークフローバージョンを提供しています。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

モデルインストール

これらのモデルは一度だけインストールする必要があります。ワークフロー画像にもモデルダウンロード情報が含まれているため、お好みのダウンロード方法を選択できます。 以下のモデルは Wan_2.1_ComfyUI_repackagedWan2.1-Fun で見つかります 対応するリンクをクリックしてダウンロードしてください。以前に Wan 関連のワークフローを使用したことがある場合は、Diffusion models のみをダウンロードする必要があります。 Diffusion models - 1.3B または 14B を選択。14B バージョンはファイルサイズが大きく(32GB)、VRAM 要件も高くなります:

wan2.1_fun_control_1.3B_bf16.safetensors

Wan2.1 Fun Control 1.3B 拡散モデル — 軽量版、VRAM要件が低い

Wan2.1-Fun-14B-Control

Wan2.1 Fun Control 14B 拡散モデル。ダウンロード後に Wan2.1-Fun-14B-Control.safetensors にリネームしてください。32GB以上のファイルサイズ、VRAM要件が高い
Text encoders - 以下のモデルのいずれかを選択(fp16 精度はサイズが大きく、パフォーマンス要件が高くなります):

umt5_xxl_fp16.safetensors

UMT5 XXL テキストエンコーダー — fp16 精度、サイズが大きく、高性能

umt5_xxl_fp8_e4m3fn_scaled.safetensors

UMT5 XXL テキストエンコーダー — fp8 精度、サイズが小さく、パフォーマンス要件が低い
VAE

wan_2.1_vae.safetensors

Wan2.1 VAE モデル
CLIP Vision

clip_vision_h.safetensors

参照画像を処理するための CLIP Vision モデル
ファイル保存場所:

ComfyUI ネイティブワークフロー

このワークフローでは、Load Image ノードが現在 mp4 形式をサポートしていないため、WebP 形式に変換された動画を使用します。また、元の動画の事前処理にCanny Edgeを使用します。 多くのユーザーがカスタムノードのインストール時にインストール失敗や環境問題に遭遇するため、このバージョンのワークフローはよりスムーズな体験を保証するためにネイティブノードのみを使用します。 機能豊富なノードを提供する強力な ComfyUI 作者に感謝します。関連バージョンを直接確認したい場合は、カスタムノードを使用するワークフロー を参照してください。

1. ワークフローファイルのダウンロード

Wan2.1 Fun Control ネイティブワークフロー

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

ワークフロー画像をダウンロードし、ComfyUI にドラッグしてワークフローをロードします
入力素材

開始画像: wan2.1_fun_control_start_frame.png

ネイティブワークフロー用の開始フレーム。この画像をダウンロードして使用するか、独自のものに置き換えてください。

制御動画: 01-portrait_video.webp

ネイティブワークフロー用の WebP 形式の制御動画。ネイティブワークフローでは Load Image が mp4 をサポートしていないため、WebP 形式が必要です。

2. ワークフローを段階的に完了する

Wan2.1 Fun Control ワークフロー手順
  1. Load Diffusion Model ノードが wan2.1_fun_control_1.3B_bf16.safetensors をロードしていることを確認
  2. Load CLIP ノードが umt5_xxl_fp8_e4m3fn_scaled.safetensors をロードしていることを確認
  3. Load VAE ノードが wan_2.1_vae.safetensors をロードしていることを確認
  4. Load CLIP Vision ノードが clip_vision_h.safetensors をロードしていることを確認
  5. 開始フレームを Load Image ノード(Start_image にリネーム済み)にアップロード
  6. 2 番目の Load Image ノードに制御動画をアップロード。注意:このノードは現在 mp4 をサポートしておらず、WebP 動画のみ使用可能
  7. (オプション)プロンプトを変更(英語と中国語の両方をサポート)
  8. (オプション)WanFunControlToVideo で動画サイズを調整し、過度に大きな寸法を避ける
  9. Run ボタンをクリックするか、ショートカット Ctrl(cmd) + Enter を使用して動画生成を実行

3. 使用上の注意

  • 制御動画と同じ数のフレームを WanFunControlToVideo ノードに入力する必要があるため、指定されたフレーム数が実際の制御動画フレーム数を超えると、余分なフレームが制御条件に準拠しないシーンを表示する可能性があります。この問題は カスタムノードを使用するワークフロー で解決します
  • 過度に大きな寸法を設定しないでください。サンプリングプロセスが非常に時間がかかる可能性があります。まず小さな画像を生成してからアップスケールしてください
  • このワークフローを基に、テキストから画像へ、または他のタイプのワークフローを追加して、直接テキストから動画生成やスタイル変換を実現するために想像力を発揮してください
  • より豊富な制御オプションのために ComfyUI-comfyui_controlnet_aux などのツールを使用してください

カスタムノードを使用するワークフロー

以下の 2 つのカスタムノードをインストールする必要があります: ComfyUI Manager を使用して不足ノードをインストールするか、各カスタムノードパッケージのインストール手順に従ってください。

1. ワークフローファイルのダウンロード

Wan2.1 Fun Control ワークフロー

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロード、またはテンプレートライブラリで「Wan 2.1 ControlNet」を検索
入力素材

開始画像: wan2.1_fun_control_start_frame.png

カスタムノードワークフロー用の開始フレームです。この画像をダウンロードして使用するか、ご自身の画像に置き換えてください。

コントロールビデオ: wan2.1_fun_control_control_video.mp4

カスタムノードワークフロー用の入力コントロールビデオ(MP4 形式)です。カスタム Load Video ノードは mp4 形式をサポートしています。

2. ワークフローを段階的に完了する

カスタムノードを使用する Wan2.1 Fun Control ワークフローの手順
モデル部分は基本的に同じです。ネイティブのみのワークフローをすでに体験している場合は、対応する画像を直接アップロードして実行できます。
  1. Load Diffusion Model ノードが wan2.1_fun_control_1.3B_bf16.safetensors をロードしていることを確認
  2. Load CLIP ノードが umt5_xxl_fp8_e4m3fn_scaled.safetensors をロードしていることを確認
  3. Load VAE ノードが wan_2.1_vae.safetensors をロードしていることを確認
  4. Load CLIP Vision ノードが clip_vision_h.safetensors をロードしていることを確認
  5. 開始フレームを Load Image ノードにアップロード
  6. mp4 形式の動画を Load Video(Upload) カスタムノードにアップロード。このワークフローではデフォルトの frame_load_cap が調整されていることに注意
  7. 現在の画像の場合、DWPose Estimatordetect_face オプションのみを使用
  8. (オプション)プロンプトを変更(英語と中国語の両方をサポート)
  9. (オプション)WanFunControlToVideo で動画サイズを調整し、過度に大きな寸法を避ける
  10. Run ボタンをクリックするか、ショートカット Ctrl(cmd) + Enter を使用して動画生成を実行

3. ワークフローの注意点

ComfyUI コミュニティの作者によるカスタムノードパッケージに感謝します:
  • この例では mp4 動画をサポートするために Load Video(Upload) を使用
  • Load Video(Upload) から取得した video_info により、出力動画の fps を同じに保つことができます
  • DWPose EstimatorComfyUI-comfyui_controlnet_aux ノードパッケージの他の前処理ツールに置き換えることができます
  • プロンプトは複数の言語をサポート

使用テクニック

複数の制御動画を適用
  • 有用なテクニックとして、複数の画像事前処理技術を組み合わせ、Image Blend ノードを使用して複数の制御方法を同時に適用する目標を達成できます。
  • ComfyUI-VideoHelperSuiteVideo Combine ノードを使用して、動画を mp4 形式で保存できます
  • SaveAnimatedWEBP を使用するのは、現在mp4 へのワークフロー埋め込みをサポートしておらず、一部のカスタムノードもワークフロー埋め込みをサポートしていない可能性があるためです。動画にワークフローを保存するために、SaveAnimatedWEBP ノードを選択します。
  • WanFunControlToVideo ノードでは、control_video は必須ではないため、場合によっては制御動画を使用せずに、320x320 などの非常に小さな動画サイズを最初に生成し、それらを制御動画入力として使用して一貫した結果を達成できます。
  • ComfyUI-WanVideoWrapper
  • ComfyUI-KJNodes