- 音频驱动视频生成:将静态图片和音频转化为同步视频
- 电影级画质:生成具有自然表情和动作的高质量视频
- 分钟级生成:支持长时长视频创作
- 多格式支持:适用于全身和半身角色
- 增强动作控制:可根据文本指令生成动作和环境
Wan2.2 S2V ComfyUI 原生工作流
Wan2.2-S2V 音频驱动视频生成
将静态图像和音频转化为动态视频,实现完美同步和分钟级生成。
在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索「Wan2.2 S2V」
video_wan2_2_14B_s2v_reference_image.jpg
LoadImage node 52 · video_wan2_2_14B_s2v_reference_image.jpgvideo_wan2_2_14B_s2v_input_audio.MP3
LoadAudio node 58 · video_wan2_2_14B_s2v_input_audio.MP3
2. 模型链接
你可以在 我们的仓库 中找到所有模型。 diffusion_modelswan2.2_s2v_14B_fp8_scaled.safetensors
FP8 缩放扩散模型。放置在
ComfyUI/models/diffusion_models/wan2.2_s2v_14B_bf16.safetensors
BF16 扩散模型。放置在
ComfyUI/models/diffusion_models/wav2vec2_large_english_fp16.safetensors
音频编码器模型。放置在
ComfyUI/models/audio_encoders/wan_2.1_vae.safetensors
Wan2.1 VAE 模型。放置在
ComfyUI/models/vae/umt5_xxl_fp8_e4m3fn_scaled.safetensors
FP8 缩放文本编码器。放置在
ComfyUI/models/text_encoders/3. 工作流说明

3.1 关于 Lightning LoRA
3.2 关于 fp8_scaled 和 bf16 模型
你可以在 这里 找到两种模型:wan2.2_s2v_14B_fp8_scaled.safetensors
FP8 缩放扩散模型
wan2.2_s2v_14B_bf16.safetensors
BF16 扩散模型
wan2.2_s2v_14B_fp8_scaled.safetensors,它需要更少的显存。但你可以尝试 wan2.2_s2v_14B_bf16.safetensors 来减少质量损失。
3.3 逐步操作说明
步骤 1:加载模型- UNet加载器:加载
wan2.2_s2v_14B_fp8_scaled.safetensors或wan2.2_s2v_14B_bf16.safetensors- 该工作流使用
wan2.2_s2v_14B_fp8_scaled.safetensors,它需要更少的显存 - 但你可以尝试
wan2.2_s2v_14B_bf16.safetensors来减少质量损失
- 该工作流使用
- 加载CLIP:加载
umt5_xxl_fp8_e4m3fn_scaled.safetensors - 加载VAE:加载
wan_2.1_vae.safetensors - AudioEncoderLoader:加载
wav2vec2_large_english_fp16.safetensors - LoraLoaderModelOnly:加载
wan2.2_t2v_lightx2v_4steps_lora_v1.1_high_noise.safetensors(Lightning LoRA)- 我们测试了所有 wan2.2 lightning LoRA。由于这并不是一个专门为 Wan2.2 S2V 训练的 LoRA,很多键值不匹配,但我们添加了它,因为它能大幅减少生成时间。我们将继续优化这个模板。
- 使用它会导致极大的动态和质量损失
- 如果你发现输出质量太差,可以尝试原始的 20 步工作流
- LoadAudio:上传我们提供的音频文件,或你自己的音频
- 加载图像:上传参考图片
- 批处理大小:根据你添加的 Video S2V Extend 子图节点数量设置
- 每个 Video S2V Extend 子图会为最终输出添加 77 帧
- 例如:如果添加了 2 个 Video S2V Extend 子图,批处理大小应设为 3,即总采样迭代次数
- Chunk Length:保持默认值 77
- 采样器设置:根据是否使用 Lightning LoRA 选择不同设置
- 使用 4 步 Lightning LoRA: steps: 4, cfg: 1.0
- 不使用 4 步 Lightning LoRA: steps: 20, cfg: 6.0
- 尺寸设置:设置输出视频的尺寸
- Video S2V Extend:视频扩展子图节点。由于默认每次采样帧数为 77,且这是一个 16fps 的模型,每个扩展将生成 77 / 16 = 4.8125 秒的视频
- 你需要一定的计算来使视频扩展子图节点的数量与输入音频长度匹配。例如:如果输入音频为 14 秒,则需要的总帧数为 14x16=224,每个视频扩展为 77 帧,所以你需要 224/77 ≈ 2.9,向上取整则为 3 个视频扩展子图节点
- 使用 Ctrl-Enter 或点击运行按钮来执行工作流