Skip to main content
HeyGen Video 1.0 は HeyGen の汎用ビデオモデルで、映像、セリフ、環境音を一度の生成で作り出します。プロンプトでショットとセリフを記述すると、音声が同期されたクリップが返ってくるため、トーキングヘッドや製品ビデオの制作に撮影も、プレゼンターも、別途のナレーション工程も必要ありません。 ComfyUI では、このモデルは 2 つのパートナーノードを通じて実行されます。HeyGen Video 1.0 Reference to Video はテキストからビデオへの生成を単独で処理し、画像、ビデオ、またはオーディオが接続されると参照からビデオへの生成を処理します。HeyGen Video 1.0 Image to Video は最初のフレームから生成を開始します。どちらもクラウドAPIノードで、クレジットのある Comfy アカウントが必要となり、ローカルモデルのダウンロードは行いません。1 秒あたりの料金についてはパートナーノードクレジットをご覧ください。 すべての実行で 5 ~ 15 秒のクリップが 480p または 768p で返され、セリフ、ルームトーン、そして音楽がある場合はそれも既にビデオに含まれています。
APIノードを使用するには、正しくログインしていることと、許可されたネットワーク環境で使用していることを確認する必要があります。APIノードの使用に必要な具体的な要件については、ドキュメントの「APIノードの概要」セクションをご参照ください。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

利用可能なワークフロー

テキストから動画へ

プロンプトだけでクリップを生成します。プロンプトが動作、セリフ、サウンドを担うため、1回のノード実行で完成したトーキングクリップが返されます。

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで “HeyGen Video 1.0: Text to Video” を検索してください
テキストから動画へのテンプレートは、何も接続せずに Reference to Video ノードを実行します。これがこのノードのテキストから動画へのモードです。

画像から動画へ

1枚の画像をアニメートします。その画像がクリップの最初のフレームになり、出力はアスペクト比を維持するため、異なる形状が必要な場合は画像をクロップしてください。プロンプトが、何が起こるか、何が話されるかを決めます。

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで “HeyGen Video 1.0: Image to Video” を検索してください
入力マテリアル

model_red_curls_ring.png

HeyGen Video 1.0 Image to Video ノードに渡す LoadImage ノードに読み込んでください

リファレンスから動画へ

人物、製品、場所をリファレンスとして接続することで、ショット全体を通して一貫させます。最大9枚の画像、3本のビデオ、3つのオーディオクリップ、合計12個です。プロンプトでは、それらを @Image1、@Video1、@Audio1 として参照します。番号は種類ごとに入力順に付けられます。

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで “HeyGen Video 1.0: Reference to Video” を検索してください
入力マテリアル

model_black_blazer_red_earrings.png

最初のリファレンス画像スロットに読み込む · @Image1

cognac_leather_handbag.png

2番目のリファレンス画像スロットに読み込む · @Image2

ノードのコントロール

Image to Video ノードは、画像、プロンプト、再生時間、解像度、シードを受け取ります。最初のフレームがクリップの形状を決めるため、アスペクト比のコントロールはありません。

プロンプトのヒント

  • 発話するセリフはプロンプトに書く。台詞はショットの説明の一部として引用符で囲みます。そうすることで、モデルがそのセリフを話し、口の動きも一致します。両方のテンプレートには長いサンプルプロンプトが付属しており、その形を示しています。まずショットと被写体、次に引用符で囲んだセリフ、その後にサウンドとカメラの表現が続きます。
  • サウンドは映像と一緒に記述する。ルームトーン、音楽、あるいは動作が発するノイズは、コントロールで設定するのではなくプロンプトに書き込みます。サンプルプロンプトはアンビエンスで終わります。たとえば、かすかなケトルの笛音を伴う静かなルームトーンや、物を置くときの柔らかなグラスの触れ合う音などです。
  • 製品や出演者の一貫性を保つ。製品や人物を参照画像として接続し、プロンプト内でその名前を挙げてから、どのように同じ状態を保つ必要があるかを記述します。たとえば、@Image2 のバッグの正確な色、比率、金具を維持するなどです。
  • 参照画像でショットを形作る。aspect_ratio を auto に設定すると、フレーミングは最初の参照画像に従うため、最初に接続した参照画像がビデオの形状を決めます。
  • 実行ごとのばらつきを想定する。シードは結果を固定しません。同じ設定でも異なるテイクが生成されることがあります。

はじめる

  1. ComfyUIを最新バージョンにアップデート
  2. テンプレートライブラリに移動し、HeyGen Video 1.0 を検索