Skip to main content
Wan 3.0 は Alibaba の最新ビデオ生成モデルで、パートナーノードを介して ComfyUI で利用できるようになりました。同期されたオーディオトラックを備え、1回のパスで最大30秒のビデオを生成します。また、テキストプロンプトを参照画像、ビデオ、オーディオと組み合わせて、一貫したキャラクターとシーンを実現します。
APIノードを使用するには、正しくログインしていることと、許可されたネットワーク環境で使用していることを確認する必要があります。APIノードの使用に必要な具体的な要件については、ドキュメントの「APIノードの概要」セクションをご参照ください。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

主な機能

  • 最大30秒: 一貫性のある動きとオーディオを備えた長時間クリップを一度の処理で生成します
  • ネイティブオーディオ: すべての出力には、デフォルトで同期されたオーディオトラックが含まれます
  • テキスト、画像、参照入力: テキストのみのプロンプト、先頭フレームからのアニメーション、または最大10枚の参照画像、5本の参照ビデオ、5つの参照オーディオクリップ
  • 参照タグ: プロンプト内で接続されたメディアを @Image1@Video1@Audio1 のように直接参照できます
  • 柔軟な出力: 480p、720p、1080pの解像度と、アダプティブ、16:9、9:16、1:1、4:3、3:4 のアスペクト比に対応
  • バイリンガルプロンプト: 英語または中国語でプロンプトを入力できます

Wan 3.0 テキストから動画へのワークフロー

テキストプロンプトのみからビデオを生成します。デフォルトで同期オーディオが含まれます。

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで「Wan 3.0」を検索

プロンプトのヒント

  1. 再生時間: 2〜30秒に設定するか、auto を指定するとモデルがプロンプトに合った再生時間を選択します
  2. 解像度と比率: ワークフローは adaptive 比率の720pで提供されます。特定のフォーマット向けに1080pや 16:9 などの固定比率に切り替えてください
  3. オーディオ: オーディオはデフォルトで生成されます。audio オプションを無効にすると無音のビデオになります
  4. プロンプト拡張: プロンプトの拡張はデフォルトで有効で、より良い結果を得るためにプロンプトを書き換えます。正確な文言が必要な場合は、高度な機能の設定でオフにしてください

Wan 3.0 画像から動画へのワークフロー

1枚の画像をビデオにアニメートします。出力が遷移していく最終フレームを、オプションで指定できます。

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで「Wan 3.0」を検索してください

プロンプトのヒント

  1. 最初のフレーム: first_frame 入力は必須です。last_frame 入力はオプションで、モデルは2つのフレーム間の動きを生成します。
  2. アダプティブ比率: adaptive を使用すると、出力サイズが入力画像に追従します。
  3. プロンプト: 何がどのように動くかと、希望するオーディオを記述します。モデルに変更させたい場合を除き、被写体と構図は変えないでください。

Wan 3.0 参照から動画ワークフロー

参照画像、参照ビデオ、参照オーディオを条件としてビデオを生成します。各参照には、プロンプト内のタグを通じてジョブが割り当てられます。

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで「Wan 3.0」を検索

プロンプトのヒント

  1. タグによる参照:プロンプト内で各入力を @Image1@Video1@Audio1 のように参照します。タイプごとに入力順に番号が付けられます。サンプルプロンプトでは、靴のデザインを @Image1 に、キャラクターを @Image2 に割り当てています。
  2. 制限:参照画像は最大10枚、参照ビデオは最大5本、参照オーディオクリップは最大5個です。各参照ビデオまたはオーディオクリップは15秒以下である必要があり、すべての参照ビデオの合計再生時間も15秒以内に収める必要があります(オーディオも同様)。参照ビデオと出力の合計再生時間は30秒を超えてはなりません。
  3. ジョブの割り当て:各参照が何を制御するか(商品デザイン、キャラクターの外見、スタイル、動き、声)と、何を変更せずに保つかを明記します。明示的な割り当てにより、より一貫性のある結果が得られます。
  4. プロンプトまたは参照が必須:プロンプトまたは少なくとも1つの参照入力を指定してください。指定しない場合、ノードはエラーを返します。

はじめる

  1. ComfyUIを最新バージョンにアップデートするか、最新のComfy Desktopを使用します
  2. テンプレートライブラリに移動し、Wan 3.0 を検索します
  3. 3つのワークフロー(テキストから動画へ、画像から動画へ、または参照から動画)のいずれかを読み込みます
  4. Comfyアカウントでログインし、十分なクレジットがあることを確認します
  5. 入力素材(最初のフレームまたは参照画像)を接続して実行します

よくある質問

Wan 3.0 は、Alibaba の最新のビデオ生成モデルで、ComfyUI ではパートナーノードを通じて利用できます。テキストプロンプト、参照画像、参照ビデオ、参照オーディオを受け付け、同期したオーディオ付きの最大 30 秒のビデオを 1 回のパスで生成します。
クリップあたり最大 30 秒です。再生時間の入力では、2〜30 秒、または auto を指定できます。auto を指定すると、モデルがプロンプトに合った再生時間を選択します。
はい。デフォルトでは、すべての出力に同期したオーディオトラックが含まれ、セリフ、サウンドエフェクト、音楽がビデオと一緒に生成されます。無音ビデオにするには、audio オプションを無効にします。
はい、参照から動画ワークフローで使用できます。参照画像を最大 10 枚、参照ビデオを最大 5 本、参照オーディオを最大 5 個接続し、プロンプト内で @Image1@Video1@Audio1 として参照します。
Wan 3.0 は、Alibaba のビデオモデルの最新世代です。画像、ビデオ、オーディオの参照タグ、デフォルトのネイティブ同期オーディオ、クリップあたり最大 30 秒の出力を備え、マルチモーダルパイプラインを拡張します。前世代については、Wan 2.7 ページ を参照してください。
はい。プロンプト入力は英語と中国語の両方をサポートしています。