- 首尾帧精准控制:首尾帧匹配度达98%,通过起始和结束画面定义视频边界,模型智能填充中间动态变化,实现场景转换和物体形态演变等效果。
- 稳定流畅视频生成:采用CLIP语义特征和交叉注意力机制,视频抖动率比同类模型降低37%,确保转场自然流畅。
- 多功能创作能力:支持中英文字幕动态嵌入、二次元/写实/奇幻等多风格生成,适应不同创作需求。
- 720p高清输出:直接生成1280×720分辨率视频,无需后处理,适用于社交媒体和商业应用。
- 开源生态支持:模型权重、代码及训练框架全面开源,支持主流AI平台部署。
- DiT架构:基于扩散模型和Diffusion Transformer架构,结合Full Attention机制优化时空依赖建模,确保视频连贯性。
- 三维因果变分编码器:Wan-VAE技术将高清画面压缩至1/128尺寸,同时保留细微动态细节,显著降低显存需求。
- 三阶段训练策略:从480P分辨率开始预训练,逐步提升至720P,通过分阶段优化平衡生成质量与计算效率。
- GitHub代码仓库:GitHub
- Hugging Face模型页:Hugging Face
- ModelScope(魔搭社区):ModelScope
Wan2.1 FLF2V 720P ComfyUI 原生工作流示例
1. 下载工作流文件及相关输入文件
将 ComfyUI 更新至最新版本,然后下载工作流文件并拖入 ComfyUI,或者在模板库中通过Workflow → 浏览模板 → Video 查找 “Wan2.1 FLF2V 720P”。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索 “Wan2.1 FLF2V”
起始图片: wan2.1_flf2v_720_f16_start_image.png
视频生成的起始帧(LoadImage 节点 52)。下载并使用此图片,或替换为你自己的图片。
结束图片: wan2.1_flf2v_720_f16_end_image.png
视频生成的结束帧(LoadImage 节点 72)。下载并使用此图片,或替换为你自己的图片。
2. 手动模型安装
本篇指南涉及的所有模型你都可以在这里找到。 扩散模型:根据你的硬件选择一个版本扩散模型: Wan2.1 FLF2V 14B FP16
wan2.1_flf2v_720p_14B_fp16.safetensors:全精度,需要更多显存。放置于
ComfyUI/models/diffusion_models/扩散模型: Wan2.1 FLF2V 14B FP8
wan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensors:量化版本,显存占用更低。放置于
ComfyUI/models/diffusion_models/文本编码器: UMT5 XXL FP16
umt5_xxl_fp16.safetensors:全精度文本编码器。放置于
ComfyUI/models/text_encoders/文本编码器: UMT5 XXL FP8
umt5_xxl_fp8_e4m3fn_scaled.safetensors:量化文本编码器。放置于
ComfyUI/models/text_encoders/VAE: Wan2.1 VAE
wan_2.1_vae.safetensors:用于编码/解码的 Wan2.1 VAE。放置于
ComfyUI/models/vae/CLIP视觉: CLIP Vision H
clip_vision_h.safetensors:CLIP视觉编码器。放置于
ComfyUI/models/clip_vision/3. 按步骤完成工作流执行

- 确保
UNet加载器节点已加载wan2.1_flf2v_720p_14B_fp16.safetensors或wan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensors - 确保
加载CLIP节点已加载umt5_xxl_fp8_e4m3fn_scaled.safetensors - 确保
加载VAE节点已加载wan_2.1_vae.safetensors - 确保
加载CLIP视觉节点已加载clip_vision_h.safetensors - 将起始帧上传到
Start_image节点 - 将结束帧上传到
End_image节点 - (可选)修改正向和负面提示词,中英文均可
- (重要)在
Wan首尾帧视频中我们默认使用 7201280 的尺寸,因为这是一个720P模型,使用较小尺寸会无法获得良好输出。请使用接近 7201280 的尺寸以获得较好生成效果。 - 点击
执行按钮,或使用快捷键Ctrl(cmd) + Enter来执行视频生成