- 音频驱动口型同步:生成与输入音频相匹配的自然口型动作
- 全身动作:在保留身份、背景和相机运动的同时,添加同步的身体动作
- 双模式:同时支持单角色和多角色场景
- ComfyUI 原生支持:内置
WanInfiniteTalkToVideo节点,无需自定义节点
了解子图
此工作流使用子图节点进行模块化处理。请查看子图文档,了解如何自定义和扩展该工作流。
InfiniteTalk 图生视频工作流
在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索 “InfiniteTalk”
模型安装
需要下载以下模型并将其放入正确的目录: diffusion_models text_encoders model_patches- wan2.1_infiniteTalk_single_fp16.safetensors:适用于单角色场景
- wan2.1_infiniteTalk_multi_fp16.safetensors:适用于多角色场景
模型存放位置
示例输入文件
下载这些示例输入文件,并将它们拖入对应的节点:下载示例图像
角色参考图像
下载说话人 1 音频
角色 1 的音频轨道
下载说话人 2 音频
角色 2 的音频轨道
工作流步骤
- 加载输入图像:将角色参考图像拖拽到
Load Image节点。对于多角色场景,使用遮罩编辑器为每个角色绘制遮罩。 - 加载音频轨道:将音频文件连接到
Load Audio节点(每个角色一个)。 - 加载扩散模型:确保
Load Diffusion Model节点使用的是Wan2_1-I2V-14B-480p_fp8_e4m3fn_scaled_KJ.safetensors。 - 加载模型补丁:通过
ModelPatchLoader节点加载相应的 InfiniteTalk 补丁(single或multi变体)。 - 配置 InfiniteTalk:调整
WanInfiniteTalkToVideo节点的参数,例如length(视频长度,以帧为单位)、motion_frame_count(用作运动上下文的之前帧数)以及audio_scale。 - 生成:运行工作流。模型将生成与输入音频同步的全身说话视频。
扩展视频长度
每个 Video Extend 组会将视频延长约 3.24 秒(25 fps 下的 81 帧)。如果你的音频更长,可以:- 框选 “Video Extend” 组
- 按
Ctrl-C(复制),然后按Ctrl-Shift-V(带连线粘贴) - 将上一个
InfiniteTalk (Base Generation)节点的IMAGE输出连接到新的WanInfiniteTalkToVideo节点的previous_frames输入 - 将
Batch Images节点的IMAGE输出连接到新的Batch Images节点的图像输入