fl2va 和 ref2va transformer 文件。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索 “MiniMax H3 Fun ControlNet Union”
加载视频 节点:
dancer_field_pose.mp4
示例工作流使用的 Pose 控制视频,也可以使用你自己的视频。
Apply MiniMax H3 Fun ControlNet 节点的 control_video 输入。
模型下载
Diffusion 模型:minimax_h3_ref2va_pruned_int8_convrot
请放到
ComfyUI/models/diffusion_models/ 目录下ControlNet 补丁:minimax_h3_fun_controlnet_union_pruned_int8_convrot
请放到
ComfyUI/models/model_patches/ 目录下文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq
请放到
ComfyUI/models/text_encoders/ 目录下VAE:minimax_h3_video_vae_fp16
请放到
ComfyUI/models/vae/ 目录下VAE:minimax_h3_audio_vae_fp32
请放到
ComfyUI/models/vae/ 目录下LoRA:minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16
为可选的 Lightning LoRA turbo 模式提供驱动。请放到
ComfyUI/models/loras/ 目录下Checkpoint:sdpose_wholebody_fp16
供内置 SDPose 子图使用的姿态提取器。请放到
ComfyUI/models/checkpoints/ 目录下检测器:rt_detr_v4-x-hgnet_fp16
供内置 SDPose 子图使用的人物检测器。请放到
ComfyUI/models/diffusion_models/ 目录下模型存储
提示技巧
- 视频长度:目标视频以 24fps 在 17n+5 帧网格上运行 5 到 15 秒(124 帧 = 5 秒)。长于目标的控制视频会被裁剪至其开头几帧;较短的视频则会保持其最后一帧。若要精确匹配控制视频的长度,请将示例中计算出的
batch_size输出连线到MiniMax H3 Reference to Video节点的长度输入。 - 引导与强度:将
guidance_scale保持在 1.0。只有当输出偏离控制视频时,才将补丁strength提高到 1 以上。 - 视频 inpainting:将遮罩连接到
mask输入:标记为1的区域会在可选的source_video输入控制下重新生成,而画面其余部分保持不变。 - Turbo 模式(可选):勾选 Lightning LoRA 复选框,可使用 4 步 turbo LoRA 大幅加快生成速度,音频和动作质量会略有下降。
- 准备控制视频:ComfyUI 为每种控制类型内置了对应的预处理节点。边缘检测请参阅 Detect Edges (Canny) 节点,深度图请参阅 Depth Anything 3 教程。