- オーディオ駆動のリップシンク: 入力オーディオに合った自然な口の動きを生成
- 全身の動き: 同一性、背景、カメラワークを保ちながら、同期した体の動きを追加
- デュアルモード: 単一キャラクターと複数キャラクターの両方のシナリオに対応
- ComfyUI ネイティブ: 組み込みの
WanInfiniteTalkToVideoノードがあり、カスタムノードは不要
Subgraph について学ぶ
このワークフローでは、モジュール化処理のために Subgraph ノードを使用します。カスタマイズや拡張の方法については、Subgraph のドキュメントを参照してください。
InfiniteTalk 画像から動画へのワークフロー
Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで「InfiniteTalk」を検索してください
モデルのインストール
以下のモデルをダウンロードし、正しいディレクトリに配置する必要があります。 diffusion_models text_encoders model_patches- wan2.1_infiniteTalk_single_fp16.safetensors: 単一キャラクターのシナリオ向け
- wan2.1_infiniteTalk_multi_fp16.safetensors: 複数キャラクターのシナリオ向け
モデルの保存場所
サンプル入力ファイル
以下のサンプル入力ファイルをダウンロードし、対応するノードにドラッグしてください:サンプル画像をダウンロード
キャラクターの参照画像
話者1のオーディオをダウンロード
キャラクター1のオーディオトラック
話者2のオーディオをダウンロード
キャラクター2のオーディオトラック
ワークフローの手順
- 入力画像を読み込む: キャラクターの参照画像を
Load Imageノードにドラッグします。複数キャラクターのシナリオでは、マスクエディターを使って各キャラクターのマスクを描画します。 - オーディオトラックを読み込む: オーディオファイルを
Load Audioノードに接続します(キャラクターごとに1つ)。 - 拡散モデルを読み込む:
Load Diffusion ModelノードがWan2_1-I2V-14B-480p_fp8_e4m3fn_scaled_KJ.safetensorsを使用していることを確認します。 - モデルパッチを読み込む:
ModelPatchLoaderノードを介して、適切な InfiniteTalk パッチ(singleまたはmultiバリアント)を読み込みます。 - InfiniteTalk を設定する:
WanInfiniteTalkToVideoノードのパラメータを調整します。例えば、length(フレーム単位のビデオ長)、motion_frame_count(モーションコンテキストとして使用する過去のフレーム)、audio_scaleなどです。 - 生成: ワークフローを実行します。モデルは、入力オーディオに同期した全身トーキングビデオを生成します。
ビデオ長の延長
各 Video Extend グループは、ビデオを約 3.24 秒(25 fps で 81 フレーム)延長します。オーディオがそれより長い場合は、次の操作を行います。- 「Video Extend」グループをボックス選択します
Ctrl-C(コピー)を押し、続けてCtrl-Shift-V(接続を保ったまま貼り付け)を押します- 前の
InfiniteTalk (Base Generation)ノードのIMAGE出力を、新しいWanInfiniteTalkToVideoノードのprevious_frames入力に接続します Batch ImagesノードのIMAGE出力を、新しいBatch Imagesノードの画像入力に接続します