MiniMax H3 文生视频(T2V)
根据文本提示词生成视频,并带有原生立体声音频。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 T2V”
模型下载
Diffusion Model: minimax_h3_fl2va_pruned_int8_convrot
放入
ComfyUI/models/diffusion_models/文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq
放入
ComfyUI/models/text_encoders/VAE:minimax_h3_video_vae_fp16
放入
ComfyUI/models/vae/VAE:minimax_h3_audio_vae_fp32
放入
ComfyUI/models/vae/LoRA:minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16
工作流的模型扫描需要此文件;它为可选的 Lightning LoRA 加速模式提供支持。放入
ComfyUI/models/loras/模型存储
提示词技巧
- 描述整个场景:先描述整体场景(地点、角色、正在发生的事),再按时间拆分为多个镜头。
- 镜头、相机与音频:在同一个提示词块中描述镜头、相机运动及伴随音频(对话、音效、音乐)。
- 分辨率:H3 的原生画布短边为 768px,在 16:9 下即 1344x768,分辨率会按 32 的倍数取整。
- 时长:在 24fps 下,时长输入会对齐到模型每块 17 帧(17k+5)的网格。
- 首帧/末帧:将图像连接到
MiniMaxH3ImageToVideo节点的first_frame和/或last_frame,即可将此工作流变成首帧/末帧图生视频。 - Turbo 模式(可选):工作流默认以 20 步生成;如需更好的运动质量,可以提高步数(例如设为 25)。在 MiniMax H3 节点上启用
turbo_mode,即可使用随附的 Lightning LoRA(minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16)以 8 步运行,生成速度大幅提升,但音频和运动质量会略有下降。
MiniMax H3 图生视频(I2V)
从输入图像生成视频,并可选择使用首帧/末帧关键帧。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索 “MiniMax H3 I2V”
输入图像:transparent_rgb_gaming_mouse.png
下载默认输入图像,或使用你自己的图像。
模型下载
Diffusion 模型:minimax_h3_fl2va_pruned_int8_convrot
放入
ComfyUI/models/diffusion_models/文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq
放入
ComfyUI/models/text_encoders/VAE:minimax_h3_video_vae_fp16
放入
ComfyUI/models/vae/VAE:minimax_h3_audio_vae_fp32
放入
ComfyUI/models/vae/Turbo LoRA:minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16
放入
ComfyUI/models/loras/。当 turbo_mode 启用时使用。模型存储
提示技巧
- 关键帧:
first_frame和last_frame输入均为可选;模型会生成它们之间的运动。 - 提示词:在同一个提示词块中描述镜头、运动以及伴随的音频(对白、音效、音乐)。
- 分辨率:H3 的原生画布短边为 768px,在 16:9 下为 1344x768,且分辨率会四舍五入到 32 的倍数。
- 时长:时长输入会在 24fps 下对齐到模型每块 17 帧(17k+5)的网格。
- Turbo 模式:在 MiniMax H3 节点上启用
turbo_mode,即可切换到 turbo LoRA,并使用turbo_steps(默认为 8)而不是 20 步生成。turbo_model_strength控制 LoRA 强度(默认为 1.0)。
MiniMax H3 参考转视频(R2V)
通过参考图像、视频和音频的任意组合来生成视频,锁定角色、风格、运动、运镜或声音。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“MiniMax H3 R2V”
参考图像:red_superboy_on_city_roof.png
工作流使用的角色参考,也可以使用自己的图像。
参考图像:mecha_dragon_lightning.png
工作流使用的风格和主题参考,也可以使用自己的图像。
模型下载
Diffusion 模型:minimax_h3_ref2va_pruned_int8_convrot
放置到
ComfyUI/models/diffusion_models/文本编码器:qwen3vl_32b_minimax_h3_nvfp4_awq
放置到
ComfyUI/models/text_encoders/VAE:minimax_h3_video_vae_fp16
放置到
ComfyUI/models/vae/VAE:minimax_h3_audio_vae_fp32
放置到
ComfyUI/models/vae/LoRA:minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16
工作流的模型扫描必需此文件;为可选的 Lightning LoRA turbo 模式提供支持。放置到
ComfyUI/models/loras/模型存储
提示技巧
- 按标签引用:按照输入被连接时的精确顺序,通过标签引用每个输入,例如
<Picture 1>、<Video 1>、<Audio 1> - 为每个参考分配任务:说明哪个参考驱动镜头的哪一部分(身份、风格、运动、相机、声音)。明确的分配往往效果要好得多
- 限制:最多 9 张参考图像、3 段参考视频(每段都可带有自己的音轨),以及 3 段独立的参考音频片段
- ref_image_size:
match会将参考缩小到生成分辨率以提升速度;max会将短边最多保留到 2048 像素,以增强身份保真度,但会牺牲速度 - 注意:R2V 使用
ref2vadiffusion 模型,其权重与 T2V 和 I2V 工作流所用的fl2va模型不同 - Turbo 模式(可选):该工作流默认生成 20 步;可提高步数(例如增加到 25)以获得更好的运动质量。启用 Lightning LoRA 复选框,即可使用 4 步 turbo LoRA(
minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16)来大幅加快生成速度,但音频和运动质量会略微下降
使用原生节点的高级工作流
原生 MiniMax H3 节点支持最近 ComfyUI 更新中引入的另外两种工作流。要使用它们,请将 ComfyUI 更新到最新版本。将引导锚定到任意帧 (#15439)
Comfy-Org/ComfyUI#15439 中新增了MiniMaxH3AddGuide 节点。在此之前,关键帧只能锚定在视频的首帧和末帧。此节点移除了这一限制:引导可以在连续时间轴上锚定到任意帧。
将 MiniMax H3 节点的 positive 和 Latent 输出连接到 MiniMaxH3AddGuide,然后提供至少一个引导输入:
- 图像:静态图像或视频片段。多帧批次会作为片段锚定,并裁剪到模型有效的片段长度:5、22、39…帧 (17k+5)。少于 5 帧的批次仅使用第一帧图像
- 音频:在同一帧索引处锚定的音轨,裁剪到视频的剩余时长
- frame_idx:要锚定到的帧。负值从视频末尾开始计数
vae;提供音频时,将音频 VAE 连接到 audio_vae。串联多个 MiniMaxH3AddGuide 节点,可以在多个帧处锚定引导。
例如,将现有视频的前 22 帧及其音频一起送入帧 0 处的 MiniMaxH3AddGuide,模型便会生成两条流的延续。或者,在 124 帧视频的第 60 帧放置一张静态图像,迫使视频经过该帧。
首帧/末帧锚定产生的坐标与之前相同,因此现有工作流无需更改即可继续工作。
多帧参考 模板是基于此节点构建的现成工作流。
使用 Latent 噪波遮罩进行 Inpainting 与扩展 (#15375)
Comfy-Org/ComfyUI#15375 为 MiniMax H3 添加了逐 token 的噪波遮罩,覆盖视频和音频 Latent。现在,你可以只重新生成视频的一部分,同时保持其余部分不变。 照常将遮罩连接到 sampler 的denoise_mask 输入:值为 0 时保留对应的 Latent 区域,值为 1 时重新生成该区域。视频遮罩会对齐到模型的 2x2 Latent 补丁网格,音频遮罩则对齐到完整的 Latent 帧。可用于局部 inpainting、移除物体,或扩展片段,同时保持现有内容稳定。