- コアアーキテクチャ: Sora と同様の DiT (Diffusion Transformer) アーキテクチャを採用し、テキスト、画像、動作情報を効果的に融合させることで、生成された動画フレーム間の一貫性、品質、整合性を向上させます。統一されたフルアテンション機構により、被写体の一貫性を保ちながらマルチビューのカメラ遷移を実現します。
- 3D VAE: カスタム 3D VAE は動画をコンパクトな潜在空間に圧縮し、画像から動画の生成をより効率的にします。
- 優れた画像・動画・テキストの整合性: 画像と動画生成の両方に優れた MLLM テキストエンコーダーを利用し、テキスト指示への追従、詳細の捕捉、複雑な推論をより良く行います。
すべてのワークフローで共通のモデル
以下のモデルは、テキストから動画および画像から動画の両方のワークフローで使用されます。ダウンロードして、指定されたディレクトリに保存してください:Text Encoder: clip_l.safetensors
ComfyUI/models/text_encoders に保存
Text Encoder: llava_llama3_fp8_scaled.safetensors
ComfyUI/models/text_encoders に保存
VAE: hunyuan_video_vae_bf16.safetensors
ComfyUI/models/vae に保存
Hunyuan テキストから動画ワークフロー
Hunyuan Text-to-Video は 2024 年 12 月にオープンソース化され、中国語と英語の両方での自然言語記述を通じて 5 秒間のショート動画生成をサポートしています。1. ワークフロー
下のワークフロー画像をダウンロードし、ComfyUI にドラッグしてワークフローを読み込んでください:
Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで「Hunyuan Video」を検索
2. モデルの手動インストール
Diffusion Model: hunyuan_video_t2v_720p_bf16.safetensors
ComfyUI/models/diffusion_models に保存
3. ワークフローの実行手順

DualCLIPLoaderノードで以下のモデルがロードされていることを確認してください:- clip_name1: clip_l.safetensors
- clip_name2: llava_llama3_fp8_scaled.safetensors
Load Diffusion Modelノードでhunyuan_video_t2v_720p_bf16.safetensorsがロードされていることを確認してくださいLoad VAEノードでhunyuan_video_vae_bf16.safetensorsがロードされていることを確認してくださいQueueボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してワークフローを実行します
Hunyuan 画像から動画へのワークフロー
Hunyuan 画像から動画へモデルは、HunyuanVideo フレームワークをベースに、2025年3月6日にオープンソース化されました。静止画像をスムーズで高品質な動画に変換し、さらに、毛の成長や物体の変形などの特別なビデオエフェクトをカスタマイズするための LoRA トレーニングコードも提供しています。 現在、Hunyuan 画像から動画へモデルには2つのバージョンがあります:- v1 “concat”: 動きの流動性は高いが、画像ガイダンスへの従属性は低い
- v2 “replace”: v1の翌日に更新済みで、画像ガイダンスは改善されているが、v1と比較すると動きのダイナミックさがやや劣る
v1 “concat”

v2 “replace”

v1 と v2 バージョン共通のモデル
CLIPビジョン: llava_llama3_vision.safetensors
ComfyUI/models/clip_vision に保存
V1 “concat” 画像から動画へのワークフロー
1. ワークフローとアセット
以下のワークフロー画像をダウンロードし、ComfyUIにドラッグ&ドロップしてワークフローを読み込みます:
ワークフローをダウンロード
ワークフロー画像をダウンロードして ComfyUI にドラッグ
開始フレーム: robot-ballet.png
保存して I2V 生成の入力画像として使用
2. 関連モデルの手動インストール
拡散モデル: hunyuan_video_image_to_video_720p_bf16.safetensors
ComfyUI/models/diffusion_models に保存
3. ワークフローの実行手順

DualCLIPLoaderが以下のモデルを読み込んでいることを確認します:- clip_name1: clip_l.safetensors
- clip_name2: llava_llama3_fp8_scaled.safetensors
Load CLIP Visionがllava_llama3_vision.safetensorsを読み込んでいることを確認しますLoad Image Modelがhunyuan_video_image_to_video_720p_bf16.safetensorsを読み込んでいることを確認しますLoad VAEがvae_name: hunyuan_video_vae_bf16.safetensorsを読み込んでいることを確認しますLoad Diffusion Modelがhunyuan_video_image_to_video_720p_bf16.safetensorsを読み込んでいることを確認しますQueueボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してワークフローを実行します
v2「置き換え」画像から動画へのワークフロー
v2ワークフローはv1ワークフローと基本的に同じです。replaceモデルをダウンロードし、Load Diffusion Modelノードで使用するだけです。
1. ワークフローとアセット
以下のワークフロー画像をダウンロードし、ComfyUIにドラッグ&ドロップしてワークフローを読み込みます。
ワークフローをダウンロード
ワークフロー画像をダウンロードしてComfyUIにドラッグ
開始フレーム: flux_dev_example.png
保存し、I2V生成の入力画像として使用
2. 関連モデルの手動インストール
拡散モデル: hunyuan_video_v2_replace_image_to_video_720p_bf16.safetensors
ComfyUI/models/diffusion_modelsに保存
3. ワークフローの実行手順

デュアルCLIP読み込みノードに以下のモデルがロードされていることを確認します。- clip_name1: clip_l.safetensors
- clip_name2: llava_llama3_fp8_scaled.safetensors
Load CLIP Visionノードにllava_llama3_vision.safetensorsがロードされていることを確認します。画像モデル読み込みノードにhunyuan_video_image_to_video_720p_bf16.safetensorsがロードされていることを確認します。VAE読み込みノードにhunyuan_video_vae_bf16.safetensorsがロードされていることを確認します。Load Diffusion Modelノードにhunyuan_video_v2_replace_image_to_video_720p_bf16.safetensorsがロードされていることを確認します。キューボタンをクリックするか、ショートカットCtrl(cmd) + Enterを使用してワークフローを実行します。
自分で試してみる
以下に、いくつかの画像とプロンプトを提供します。そのコンテンツに基づいて、または調整を加えて、独自の動画を作成してください。


