Skip to main content
我们很高兴地宣布,先进的音频驱动视频生成模型 Wan2.2-S2V 现已原生支持 ComfyUI!这个强大的 AI 模型可以将静态图片和音频输入转化为动态视频内容,支持对话、唱歌、表演等多种创意内容需求。 模型亮点
  • 音频驱动视频生成:将静态图片和音频转化为同步视频
  • 电影级画质:生成具有自然表情和动作的高质量视频
  • 分钟级生成:支持长时长视频创作
  • 多格式支持:适用于全身和半身角色
  • 增强动作控制:可根据文本指令生成动作和环境
Wan2.2 S2V 代码仓库:GitHub Wan2.2 S2V 模型仓库:Hugging Face

Wan2.2 S2V ComfyUI 原生工作流

请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

Wan2.2-S2V 音频驱动视频生成

将静态图像和音频转化为动态视频,实现完美同步和分钟级生成。 Wan2.2-S2V 音频驱动视频生成工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索「Wan2.2 S2V」
输入材料 将以下文件上传到对应节点:

video_wan2_2_14B_s2v_reference_image.jpg

LoadImage node 52 · video_wan2_2_14B_s2v_reference_image.jpg

video_wan2_2_14B_s2v_input_audio.MP3

LoadAudio node 58 · video_wan2_2_14B_s2v_input_audio.MP3
video_wan2_2_14B_s2v_reference_image.jpg

2. 模型链接

你可以在 我们的仓库 中找到所有模型。 diffusion_models

wan2.2_s2v_14B_fp8_scaled.safetensors

FP8 缩放扩散模型。放置在 ComfyUI/models/diffusion_models/

wan2.2_s2v_14B_bf16.safetensors

BF16 扩散模型。放置在 ComfyUI/models/diffusion_models/
audio_encoders

wav2vec2_large_english_fp16.safetensors

音频编码器模型。放置在 ComfyUI/models/audio_encoders/
vae

wan_2.1_vae.safetensors

Wan2.1 VAE 模型。放置在 ComfyUI/models/vae/
text_encoders

umt5_xxl_fp8_e4m3fn_scaled.safetensors

FP8 缩放文本编码器。放置在 ComfyUI/models/text_encoders/

3. 工作流说明

工作流说明

3.1 关于 Lightning LoRA

3.2 关于 fp8_scaled 和 bf16 模型

你可以在 这里 找到两种模型:

wan2.2_s2v_14B_fp8_scaled.safetensors

FP8 缩放扩散模型

wan2.2_s2v_14B_bf16.safetensors

BF16 扩散模型
本模板使用 wan2.2_s2v_14B_fp8_scaled.safetensors,它需要更少的显存。但你可以尝试 wan2.2_s2v_14B_bf16.safetensors 来减少质量损失。

3.3 逐步操作说明

步骤 1:加载模型
  1. UNet加载器:加载 wan2.2_s2v_14B_fp8_scaled.safetensorswan2.2_s2v_14B_bf16.safetensors
    • 该工作流使用 wan2.2_s2v_14B_fp8_scaled.safetensors,它需要更少的显存
    • 但你可以尝试 wan2.2_s2v_14B_bf16.safetensors 来减少质量损失
  2. 加载CLIP:加载 umt5_xxl_fp8_e4m3fn_scaled.safetensors
  3. 加载VAE:加载 wan_2.1_vae.safetensors
  4. AudioEncoderLoader:加载 wav2vec2_large_english_fp16.safetensors
  5. LoraLoaderModelOnly:加载 wan2.2_t2v_lightx2v_4steps_lora_v1.1_high_noise.safetensors(Lightning LoRA)
    • 我们测试了所有 wan2.2 lightning LoRA。由于这并不是一个专门为 Wan2.2 S2V 训练的 LoRA,很多键值不匹配,但我们添加了它,因为它能大幅减少生成时间。我们将继续优化这个模板。
    • 使用它会导致极大的动态和质量损失
    • 如果你发现输出质量太差,可以尝试原始的 20 步工作流
  6. LoadAudio:上传我们提供的音频文件,或你自己的音频
  7. 加载图像:上传参考图片
  8. 批处理大小:根据你添加的 Video S2V Extend 子图节点数量设置
    • 每个 Video S2V Extend 子图会为最终输出添加 77 帧
    • 例如:如果添加了 2 个 Video S2V Extend 子图,批处理大小应设为 3,即总采样迭代次数
    • Chunk Length:保持默认值 77
  9. 采样器设置:根据是否使用 Lightning LoRA 选择不同设置
    • 使用 4 步 Lightning LoRA: steps: 4, cfg: 1.0
    • 不使用 4 步 Lightning LoRA: steps: 20, cfg: 6.0
  10. 尺寸设置:设置输出视频的尺寸
  11. Video S2V Extend:视频扩展子图节点。由于默认每次采样帧数为 77,且这是一个 16fps 的模型,每个扩展将生成 77 / 16 = 4.8125 秒的视频
    • 你需要一定的计算来使视频扩展子图节点的数量与输入音频长度匹配。例如:如果输入音频为 14 秒,则需要的总帧数为 14x16=224,每个视频扩展为 77 帧,所以你需要 224/77 ≈ 2.9,向上取整则为 3 个视频扩展子图节点
  12. 使用 Ctrl-Enter 或点击运行按钮来执行工作流