Skip to main content
Wan2.1 InfiniteTalk 是一个基于 Wan2.1 构建的开源音频驱动视频生成模型,由 MeiGen-AI 开发。它支持根据单张参考图像和音频输入生成全身说话视频。角色的口型动作和身体动作会自动同步,以匹配所提供的音频。 主要功能:
  • 音频驱动口型同步:生成与输入音频相匹配的自然口型动作
  • 全身动作:在保留身份、背景和相机运动的同时,添加同步的身体动作
  • 双模式:同时支持单角色和多角色场景
  • ComfyUI 原生支持:内置 WanInfiniteTalkToVideo 节点,无需自定义节点
相关链接:

了解子图

此工作流使用子图节点进行模块化处理。请查看子图文档,了解如何自定义和扩展该工作流。

InfiniteTalk 图生视频工作流

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “InfiniteTalk”
Wan2.1 InfiniteTalk 工作流预览
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

模型安装

需要下载以下模型并将其放入正确的目录: diffusion_models text_encoders model_patches audio_encoders vae loras

模型存放位置

示例输入文件

下载这些示例输入文件,并将它们拖入对应的节点:

下载示例图像

角色参考图像

下载说话人 1 音频

角色 1 的音频轨道

下载说话人 2 音频

角色 2 的音频轨道

工作流步骤

  1. 加载输入图像:将角色参考图像拖拽到 Load Image 节点。对于多角色场景,使用遮罩编辑器为每个角色绘制遮罩。
  2. 加载音频轨道:将音频文件连接到 Load Audio 节点(每个角色一个)。
  3. 加载扩散模型:确保 Load Diffusion Model 节点使用的是 Wan2_1-I2V-14B-480p_fp8_e4m3fn_scaled_KJ.safetensors。
  4. 加载模型补丁:通过 ModelPatchLoader 节点加载相应的 InfiniteTalk 补丁(single 或 multi 变体)。
  5. 配置 InfiniteTalk:调整 WanInfiniteTalkToVideo 节点的参数,例如 length(视频长度,以帧为单位)、motion_frame_count(用作运动上下文的之前帧数)以及 audio_scale。
  6. 生成:运行工作流。模型将生成与输入音频同步的全身说话视频。

扩展视频长度

每个 Video Extend 组会将视频延长约 3.24 秒(25 fps 下的 81 帧)。如果你的音频更长,可以:
  1. 框选 “Video Extend” 组
  2. 按 Ctrl-C(复制),然后按 Ctrl-Shift-V(带连线粘贴)
  3. 将上一个 InfiniteTalk (Base Generation) 节点的 IMAGE 输出连接到新的 WanInfiniteTalkToVideo 节点的 previous_frames 输入
  4. 将 Batch Images 节点的 IMAGE 输出连接到新的 Batch Images 节点的图像输入