该蒸馏检查点仅支持文本生成视频和首尾帧图生视频。Ref2VA(多参考条件)未做蒸馏;基于参考的生成请使用基础版 MiniMax H3 工作流。
环境要求
- ComfyUI 0.36.0 或更高版本
- MiniMax H3 的文本编码器和 VAE(与基础模型共用,见下方列表)
FastH3 文本生成视频
以 8 个步数从文本提示词生成带同步音频的视频。下载工作流
下载 JSON,或在模板库中搜索 “FastVideo FastH3: Text to Video”
提示词技巧
- 描述完整场景:先说明整体场景(地点、角色、正在发生什么),再拆分为按时间排列的分镜
- 分镜、镜头与音频:在一段提示词中同时描述分镜、镜头运动和配套音频(对白、音效、音乐)
- 分辨率:H3 的原生画布短边为 768px,上限为 768x1344,分辨率会取整到 32 的倍数
- 时长:时长输入会对齐到模型 24fps 下每块 17 帧(17k+5)的网格
- 步数固定为 8:该蒸馏检查点按 8 步训练;更改调度器的步数会降低质量
FastH3 图生视频
让静态图片动起来并带同步音频,支持可选的首尾帧控制。下载工作流
下载 JSON,或在模板库中搜索 “FastVideo FastH3: Image to Video”
LoadImage 节点,或使用你自己的图片:
red_line_barrier.png
图生视频工作流的示例首帧
首尾帧模式
将图片连接到MiniMaxH3ImageToVideo 节点的 first_frame 和/或 last_frame,即可在两个关键帧之间生成运动。两者都不连接时为文本生成视频。
提示词技巧
- 描述运动与音频:画面外观由图片提供,提示词应聚焦运动、镜头和配套音频
- 时长:时长输入会对齐到模型 24fps 下每块 17 帧(17k+5)的网格
- 步数固定为 8:调度器保持 8 步;该检查点按此调度蒸馏
模型下载
扩散模型来自 FastVideo 仓库;文本编码器和 VAE 与基础版 MiniMax H3 模型共用。扩散模型: fastvideo_fasth3_8step_v2_pruned_int8_convrot
放置于
ComfyUI/models/diffusion_models/文本编码器: qwen3vl_32b_minimax_h3_nvfp4_awq
放置于
ComfyUI/models/text_encoders/VAE: minimax_h3_video_vae_fp16
放置于
ComfyUI/models/vae/VAE: minimax_h3_audio_vae_fp32
放置于
ComfyUI/models/vae/模型存放位置
工作流结构说明
两个 FastH3 工作流与基础版 H3 设置共用以下节点,并带有蒸馏相关的设置:- BlockSparseAttention:以 VSA(Video Sparse Attention)运行,
keep_percent为 10,从调度的 20% 开始生效,在保持质量的同时降低注意力计算成本 - MiniMaxH3SigmaShift:应用与蒸馏调度匹配的 H3 sigma shift(视频为 10,音频为 3)
- ComfyMathExpression:将时长输入转换为 24fps 下 17k+5 网格上的有效帧
length - 采样器:
res_multistep采样器,simple调度器,8 步