主な機能
- 最大30秒: 一貫性のある動きとオーディオを備えた長時間クリップを一度の処理で生成します
- ネイティブオーディオ: すべての出力には、デフォルトで同期されたオーディオトラックが含まれます
- テキスト、画像、参照入力: テキストのみのプロンプト、先頭フレームからのアニメーション、または最大10枚の参照画像、5本の参照ビデオ、5つの参照オーディオクリップ
- 参照タグ: プロンプト内で接続されたメディアを
@Image1、@Video1、@Audio1のように直接参照できます - 柔軟な出力: 480p、720p、1080pの解像度と、アダプティブ、16:9、9:16、1:1、4:3、3:4 のアスペクト比に対応
- バイリンガルプロンプト: 英語または中国語でプロンプトを入力できます
Wan 3.0 テキストから動画へのワークフロー
テキストプロンプトのみからビデオを生成します。デフォルトで同期オーディオが含まれます。Comfy Cloudで実行
Comfy Cloudで開く
ワークフローをダウンロード
JSONをダウンロードするか、テンプレートライブラリで「Wan 3.0」を検索
プロンプトのヒント
- 再生時間: 2〜30秒に設定するか、
autoを指定するとモデルがプロンプトに合った再生時間を選択します - 解像度と比率: ワークフローは
adaptive比率の720pで提供されます。特定のフォーマット向けに1080pや16:9などの固定比率に切り替えてください - オーディオ: オーディオはデフォルトで生成されます。
audioオプションを無効にすると無音のビデオになります - プロンプト拡張: プロンプトの拡張はデフォルトで有効で、より良い結果を得るためにプロンプトを書き換えます。正確な文言が必要な場合は、高度な機能の設定でオフにしてください
Wan 3.0 画像から動画へのワークフロー
1枚の画像をビデオにアニメートします。出力が遷移していく最終フレームを、オプションで指定できます。Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで「Wan 3.0」を検索してください
プロンプトのヒント
- 最初のフレーム:
first_frame入力は必須です。last_frame入力はオプションで、モデルは2つのフレーム間の動きを生成します。 - アダプティブ比率:
adaptiveを使用すると、出力サイズが入力画像に追従します。 - プロンプト: 何がどのように動くかと、希望するオーディオを記述します。モデルに変更させたい場合を除き、被写体と構図は変えないでください。
Wan 3.0 参照から動画ワークフロー
参照画像、参照ビデオ、参照オーディオを条件としてビデオを生成します。各参照には、プロンプト内のタグを通じてジョブが割り当てられます。Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで「Wan 3.0」を検索
プロンプトのヒント
- タグによる参照:プロンプト内で各入力を
@Image1、@Video1、@Audio1のように参照します。タイプごとに入力順に番号が付けられます。サンプルプロンプトでは、靴のデザインを@Image1に、キャラクターを@Image2に割り当てています。 - 制限:参照画像は最大10枚、参照ビデオは最大5本、参照オーディオクリップは最大5個です。各参照ビデオまたはオーディオクリップは15秒以下である必要があり、すべての参照ビデオの合計再生時間も15秒以内に収める必要があります(オーディオも同様)。参照ビデオと出力の合計再生時間は30秒を超えてはなりません。
- ジョブの割り当て:各参照が何を制御するか(商品デザイン、キャラクターの外見、スタイル、動き、声)と、何を変更せずに保つかを明記します。明示的な割り当てにより、より一貫性のある結果が得られます。
- プロンプトまたは参照が必須:プロンプトまたは少なくとも1つの参照入力を指定してください。指定しない場合、ノードはエラーを返します。
はじめる
- ComfyUIを最新バージョンにアップデートするか、最新のComfy Desktopを使用します
- テンプレートライブラリに移動し、
Wan 3.0を検索します - 3つのワークフロー(テキストから動画へ、画像から動画へ、または参照から動画)のいずれかを読み込みます
- Comfyアカウントでログインし、十分なクレジットがあることを確認します
- 入力素材(最初のフレームまたは参照画像)を接続して実行します
よくある質問
Wan 3.0 とは?
Wan 3.0 とは?
Wan 3.0 は、Alibaba の最新のビデオ生成モデルで、ComfyUI ではパートナーノードを通じて利用できます。テキストプロンプト、参照画像、参照ビデオ、参照オーディオを受け付け、同期したオーディオ付きの最大 30 秒のビデオを 1 回のパスで生成します。
Wan 3.0 のビデオはどのくらいの長さにできますか?
Wan 3.0 のビデオはどのくらいの長さにできますか?
クリップあたり最大 30 秒です。再生時間の入力では、2〜30 秒、または
auto を指定できます。auto を指定すると、モデルがプロンプトに合った再生時間を選択します。Wan 3.0 はオーディオを生成しますか?
Wan 3.0 はオーディオを生成しますか?
はい。デフォルトでは、すべての出力に同期したオーディオトラックが含まれ、セリフ、サウンドエフェクト、音楽がビデオと一緒に生成されます。無音ビデオにするには、
audio オプションを無効にします。Wan 3.0 は参照画像、参照ビデオ、参照オーディオを使用できますか?
Wan 3.0 は参照画像、参照ビデオ、参照オーディオを使用できますか?
はい、参照から動画ワークフローで使用できます。参照画像を最大 10 枚、参照ビデオを最大 5 本、参照オーディオを最大 5 個接続し、プロンプト内で
@Image1、@Video1、@Audio1 として参照します。Wan 3.0 と Wan 2.7 の違いは何ですか?
Wan 3.0 と Wan 2.7 の違いは何ですか?
Wan 3.0 は、Alibaba のビデオモデルの最新世代です。画像、ビデオ、オーディオの参照タグ、デフォルトのネイティブ同期オーディオ、クリップあたり最大 30 秒の出力を備え、マルチモーダルパイプラインを拡張します。前世代については、Wan 2.7 ページ を参照してください。
Wan 3.0 は中国語のプロンプトをサポートしていますか?
Wan 3.0 は中国語のプロンプトをサポートしていますか?
はい。プロンプト入力は英語と中国語の両方をサポートしています。