Skip to main content
使用控制视频来控制 MiniMax H3 视频的运动,而不是仅依赖文本。Fun ControlNet Union 补丁(alibaba-pai/MiniMax-H3-Fun-Controlnet-Union,已包含在 Comfy-Org/MiniMax-H3 中)是一个单一 checkpoint,能以 Canny、Depth、HED、MLSD 或 Pose 控制视频作为 H3 的条件,并可使用遮罩进行视频 inpainting。它同时适用于 fl2varef2va transformer 文件。 MiniMax H3 Fun ControlNet Union 工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “MiniMax H3 Fun ControlNet Union”
输入素材 将此文件上传到对应的 加载视频 节点:

dancer_field_pose.mp4

示例工作流使用的 Pose 控制视频,也可以使用你自己的视频。
此模板需要 ComfyUI 0.35.0 或更高版本。示例使用 Pose 控制视频:内置的 SDPose 子图从输入视频中提取姿态骨骼,因此输出将复现舞者的动作。你也可以将任意预处理后的控制视频直接连接到 Apply MiniMax H3 Fun ControlNet 节点的 control_video 输入。

模型下载

Diffusion 模型:minimax_h3_ref2va_pruned_int8_convrot

请放到 ComfyUI/models/diffusion_models/ 目录下

ControlNet 补丁:minimax_h3_fun_controlnet_union_pruned_int8_convrot

请放到 ComfyUI/models/model_patches/ 目录下

文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq

请放到 ComfyUI/models/text_encoders/ 目录下

VAE:minimax_h3_video_vae_fp16

请放到 ComfyUI/models/vae/ 目录下

VAE:minimax_h3_audio_vae_fp32

请放到 ComfyUI/models/vae/ 目录下

LoRA:minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16

为可选的 Lightning LoRA turbo 模式提供驱动。请放到 ComfyUI/models/loras/ 目录下

Checkpoint:sdpose_wholebody_fp16

供内置 SDPose 子图使用的姿态提取器。请放到 ComfyUI/models/checkpoints/ 目录下

检测器:rt_detr_v4-x-hgnet_fp16

供内置 SDPose 子图使用的人物检测器。请放到 ComfyUI/models/diffusion_models/ 目录下

模型存储

提示技巧

  1. 视频长度:目标视频以 24fps 在 17n+5 帧网格上运行 5 到 15 秒(124 帧 = 5 秒)。长于目标的控制视频会被裁剪至其开头几帧;较短的视频则会保持其最后一帧。若要精确匹配控制视频的长度,请将示例中计算出的 batch_size 输出连线到 MiniMax H3 Reference to Video 节点的长度输入。
  2. 引导与强度:将 guidance_scale 保持在 1.0。只有当输出偏离控制视频时,才将补丁 strength 提高到 1 以上。
  3. 视频 inpainting:将遮罩连接到 mask 输入:标记为 1 的区域会在可选的 source_video 输入控制下重新生成,而画面其余部分保持不变。
  4. Turbo 模式(可选):勾选 Lightning LoRA 复选框,可使用 4 步 turbo LoRA 大幅加快生成速度,音频和动作质量会略有下降。
  5. 准备控制视频:ComfyUI 为每种控制类型内置了对应的预处理节点。边缘检测请参阅 Detect Edges (Canny) 节点,深度图请参阅 Depth Anything 3 教程