Skip to main content
Wan FLF2V(首尾帧视频生成)是由阿里通义万相团队推出的开源视频生成模型。其开源协议为 Apache 2.0。 用户只需提供起始帧和结束帧两张图像,模型即可自动生成中间过渡帧,输出一段逻辑连贯、自然流畅的720p高清视频。 核心技术亮点
  1. 首尾帧精准控制:首尾帧匹配度达98%,通过起始和结束画面定义视频边界,模型智能填充中间动态变化,实现场景转换和物体形态演变等效果。
  2. 稳定流畅视频生成:采用CLIP语义特征和交叉注意力机制,视频抖动率比同类模型降低37%,确保转场自然流畅。
  3. 多功能创作能力:支持中英文字幕动态嵌入、二次元/写实/奇幻等多风格生成,适应不同创作需求。
  4. 720p高清输出:直接生成1280×720分辨率视频,无需后处理,适用于社交媒体和商业应用。
  5. 开源生态支持:模型权重、代码及训练框架全面开源,支持主流AI平台部署。
技术原理与架构
  1. DiT架构:基于扩散模型和Diffusion Transformer架构,结合Full Attention机制优化时空依赖建模,确保视频连贯性。
  2. 三维因果变分编码器:Wan-VAE技术将高清画面压缩至1/128尺寸,同时保留细微动态细节,显著降低显存需求。
  3. 三阶段训练策略:从480P分辨率开始预训练,逐步提升至720P,通过分阶段优化平衡生成质量与计算效率。
相关链接
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

Wan2.1 FLF2V 720P ComfyUI 原生工作流示例

1. 下载工作流文件及相关输入文件

由于该模型在高分辨率图像上训练,使用较小尺寸可能无法获得理想效果。示例中我们使用 720 * 1280 的尺寸,这可能导致显存较低的用户运行困难,且生成耗时较长。 如有需要,请调整视频生成尺寸进行测试。请注意,较小的生成尺寸可能无法获得良好输出。
将 ComfyUI 更新至最新版本,然后下载工作流文件并拖入 ComfyUI,或者在模板库中通过 Workflow浏览模板Video 查找 “Wan2.1 FLF2V 720P”。 Wan2.1 FLF2V 720P 工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Wan2.1 FLF2V”

起始图片: wan2.1_flf2v_720_f16_start_image.png

视频生成的起始帧(LoadImage 节点 52)。下载并使用此图片,或替换为你自己的图片。

结束图片: wan2.1_flf2v_720_f16_end_image.png

视频生成的结束帧(LoadImage 节点 72)。下载并使用此图片,或替换为你自己的图片。

2. 手动模型安装

本篇指南涉及的所有模型你都可以在这里找到。 扩散模型:根据你的硬件选择一个版本

扩散模型: Wan2.1 FLF2V 14B FP16

wan2.1_flf2v_720p_14B_fp16.safetensors:全精度,需要更多显存。放置于 ComfyUI/models/diffusion_models/

扩散模型: Wan2.1 FLF2V 14B FP8

wan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensors:量化版本,显存占用更低。放置于 ComfyUI/models/diffusion_models/
如果你之前运行过 Wan Video 相关的工作流,你可能已经有了下面的这些文件。
文本编码器:选择一个版本

文本编码器: UMT5 XXL FP16

umt5_xxl_fp16.safetensors:全精度文本编码器。放置于 ComfyUI/models/text_encoders/

文本编码器: UMT5 XXL FP8

umt5_xxl_fp8_e4m3fn_scaled.safetensors:量化文本编码器。放置于 ComfyUI/models/text_encoders/
VAE

VAE: Wan2.1 VAE

wan_2.1_vae.safetensors:用于编码/解码的 Wan2.1 VAE。放置于 ComfyUI/models/vae/
CLIP视觉

CLIP视觉: CLIP Vision H

clip_vision_h.safetensors:CLIP视觉编码器。放置于 ComfyUI/models/clip_vision/
文件保存位置

3. 按步骤完成工作流执行

Wan2.1 FLF2V 720P 原生工作流步骤
  1. 确保 UNet加载器 节点已加载 wan2.1_flf2v_720p_14B_fp16.safetensorswan2.1_flf2v_720p_14B_fp8_e4m3fn.safetensors
  2. 确保 加载CLIP 节点已加载 umt5_xxl_fp8_e4m3fn_scaled.safetensors
  3. 确保 加载VAE 节点已加载 wan_2.1_vae.safetensors
  4. 确保 加载CLIP视觉 节点已加载 clip_vision_h.safetensors
  5. 将起始帧上传到 Start_image 节点
  6. 将结束帧上传到 End_image 节点
  7. (可选)修改正向和负面提示词,中英文均可
  8. 重要)在 Wan首尾帧视频 中我们默认使用 7201280 的尺寸,因为这是一个720P模型,使用较小尺寸会无法获得良好输出。请使用接近 7201280 的尺寸以获得较好生成效果。
  9. 点击 执行 按钮,或使用快捷键 Ctrl(cmd) + Enter 来执行视频生成