Skip to main content
Hunyuan Video シリーズは Tencent によって開発およびオープンソース化されたもので、130 億 (13B) パラメータ規模のハイブリッドアーキテクチャを特徴とし、テキストから動画 (Text-to-Video) および 画像から動画 (Image-to-Video) 生成の両方をサポートしています。 技術的特徴:
  • コアアーキテクチャ: Sora と同様の DiT (Diffusion Transformer) アーキテクチャを採用し、テキスト、画像、動作情報を効果的に融合させることで、生成された動画フレーム間の一貫性、品質、整合性を向上させます。統一されたフルアテンション機構により、被写体の一貫性を保ちながらマルチビューのカメラ遷移を実現します。
  • 3D VAE: カスタム 3D VAE は動画をコンパクトな潜在空間に圧縮し、画像から動画の生成をより効率的にします。
  • 優れた画像・動画・テキストの整合性: 画像と動画生成の両方に優れた MLLM テキストエンコーダーを利用し、テキスト指示への追従、詳細の捕捉、複雑な推論をより良く行います。
公式リポジトリ Hunyuan Video および Hunyuan Video-I2V で詳細を確認できます。 このガイドでは、ComfyUI において テキストから動画 および 画像から動画 のワークフローを設定する方法を順を追って説明します。
このチュートリアルのワークフロー画像のメタデータには、モデルのダウンロード情報が含まれています。それらを ComfyUI にドラッグするか、メニュー Workflows -> Open (ctrl+o) を使用して対応するワークフローを読み込むと、必要なモデルのダウンロードを促すメッセージが表示されます。あるいは、自動ダウンロードが失敗した場合や、Desktop バージョンを使用していない場合に備えて、このガイドではモデルへの直接リンクも提供しています。すべてのモデルは こちら からダウンロード可能です。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している

すべてのワークフローで共通のモデル

以下のモデルは、テキストから動画および画像から動画の両方のワークフローで使用されます。ダウンロードして、指定されたディレクトリに保存してください:

Text Encoder: clip_l.safetensors

ComfyUI/models/text_encoders に保存

Text Encoder: llava_llama3_fp8_scaled.safetensors

ComfyUI/models/text_encoders に保存

VAE: hunyuan_video_vae_bf16.safetensors

ComfyUI/models/vae に保存
保存場所:

Hunyuan テキストから動画ワークフロー

Hunyuan Text-to-Video は 2024 年 12 月にオープンソース化され、中国語と英語の両方での自然言語記述を通じて 5 秒間のショート動画生成をサポートしています。

1. ワークフロー

下のワークフロー画像をダウンロードし、ComfyUI にドラッグしてワークフローを読み込んでください: ComfyUI Workflow - Hunyuan Text-to-Video

Comfy Cloud で実行

Comfy Cloud で開く

ワークフローをダウンロード

JSON をダウンロードするか、テンプレートライブラリで「Hunyuan Video」を検索

2. モデルの手動インストール

Diffusion Model: hunyuan_video_t2v_720p_bf16.safetensors

ComfyUI/models/diffusion_models に保存
すべてのモデルファイルが正しい場所にあることを確認してください:

3. ワークフローの実行手順

ComfyUI Hunyuan Video T2V ワークフロー
  1. DualCLIPLoader ノードで以下のモデルがロードされていることを確認してください:
    • clip_name1: clip_l.safetensors
    • clip_name2: llava_llama3_fp8_scaled.safetensors
  2. Load Diffusion Model ノードで hunyuan_video_t2v_720p_bf16.safetensors がロードされていることを確認してください
  3. Load VAE ノードで hunyuan_video_vae_bf16.safetensors がロードされていることを確認してください
  4. Queue ボタンをクリックするか、ショートカット Ctrl(cmd) + Enter を使用してワークフローを実行します
EmptyHunyuanLatentVideo ノードの length パラメータが 1 に設定されている場合、モデルは静止画像を生成できます。

Hunyuan 画像から動画へのワークフロー

Hunyuan 画像から動画へモデルは、HunyuanVideo フレームワークをベースに、2025年3月6日にオープンソース化されました。静止画像をスムーズで高品質な動画に変換し、さらに、毛の成長や物体の変形などの特別なビデオエフェクトをカスタマイズするための LoRA トレーニングコードも提供しています。 現在、Hunyuan 画像から動画へモデルには2つのバージョンがあります:
  • v1 “concat”: 動きの流動性は高いが、画像ガイダンスへの従属性は低い
  • v2 “replace”: v1の翌日に更新済みで、画像ガイダンスは改善されているが、v1と比較すると動きのダイナミックさがやや劣る

v1 “concat”

HunyuanVideo v1

v2 “replace”

HunyuanVideo v2

v1 と v2 バージョン共通のモデル

CLIPビジョン: llava_llama3_vision.safetensors

ComfyUI/models/clip_vision に保存

V1 “concat” 画像から動画へのワークフロー

1. ワークフローとアセット

以下のワークフロー画像をダウンロードし、ComfyUIにドラッグ&ドロップしてワークフローを読み込みます: ComfyUI ワークフロー - Hunyuan 画像から動画 v1

ワークフローをダウンロード

ワークフロー画像をダウンロードして ComfyUI にドラッグ
以下の画像をダウンロードし、画像から動画への生成の開始フレームとして使用します:

開始フレーム: robot-ballet.png

保存して I2V 生成の入力画像として使用

2. 関連モデルの手動インストール

拡散モデル: hunyuan_video_image_to_video_720p_bf16.safetensors

ComfyUI/models/diffusion_models に保存
以下のモデルファイルがすべて正しい場所にあることを確認してください:

3. ワークフローの実行手順

ComfyUI Hunyuan Video I2V v1 ワークフロー
  1. DualCLIPLoader が以下のモデルを読み込んでいることを確認します:
    • clip_name1: clip_l.safetensors
    • clip_name2: llava_llama3_fp8_scaled.safetensors
  2. Load CLIP Visionllava_llama3_vision.safetensors を読み込んでいることを確認します
  3. Load Image Modelhunyuan_video_image_to_video_720p_bf16.safetensors を読み込んでいることを確認します
  4. Load VAEvae_name: hunyuan_video_vae_bf16.safetensors を読み込んでいることを確認します
  5. Load Diffusion Modelhunyuan_video_image_to_video_720p_bf16.safetensors を読み込んでいることを確認します
  6. Queue ボタンをクリックするか、ショートカット Ctrl(cmd) + Enter を使用してワークフローを実行します

v2「置き換え」画像から動画へのワークフロー

v2ワークフローはv1ワークフローと基本的に同じです。replaceモデルをダウンロードし、Load Diffusion Modelノードで使用するだけです。

1. ワークフローとアセット

以下のワークフロー画像をダウンロードし、ComfyUIにドラッグ&ドロップしてワークフローを読み込みます。 ComfyUI Workflow - Hunyuan Image-to-Video v2

ワークフローをダウンロード

ワークフロー画像をダウンロードしてComfyUIにドラッグ
以下の画像をダウンロードし、画像から動画への生成の開始フレームとして使用します。

開始フレーム: flux_dev_example.png

保存し、I2V生成の入力画像として使用

2. 関連モデルの手動インストール

拡散モデル: hunyuan_video_v2_replace_image_to_video_720p_bf16.safetensors

ComfyUI/models/diffusion_modelsに保存
すべてのモデルファイルが正しい場所にあることを確認してください。

3. ワークフローの実行手順

ComfyUI Hunyuan Video I2V v2 Workflow
  1. デュアルCLIP読み込みノードに以下のモデルがロードされていることを確認します。
    • clip_name1: clip_l.safetensors
    • clip_name2: llava_llama3_fp8_scaled.safetensors
  2. Load CLIP Visionノードにllava_llama3_vision.safetensorsがロードされていることを確認します。
  3. 画像モデル読み込みノードにhunyuan_video_image_to_video_720p_bf16.safetensorsがロードされていることを確認します。
  4. VAE読み込みノードにhunyuan_video_vae_bf16.safetensorsがロードされていることを確認します。
  5. Load Diffusion Modelノードにhunyuan_video_v2_replace_image_to_video_720p_bf16.safetensorsがロードされていることを確認します。
  6. キューボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してワークフローを実行します。

自分で試してみる

以下に、いくつかの画像とプロンプトを提供します。そのコンテンツに基づいて、または調整を加えて、独自の動画を作成してください。 example

example

example

example