Skip to main content

关于 Wan2.1-Fun-InP

Wan-Fun InP 是阿里巴巴推出的开源视频生成模型,属于 Wan2.1-Fun 系列的一部分,专注于通过图像生成视频并实现首尾帧控制。 核心功能
  • 首尾帧控制:支持输入首帧和尾帧图像,生成两者之间的过渡视频,提升视频连贯性与创意自由度。相比早期社区版本,阿里官方模型生成的结果更稳定,质量也显著更高。
  • 多分辨率支持:支持生成 512×512、768×768、1024×1024 等分辨率的视频,适配不同场景需求。
模型版本
  • 1.3B 轻量版:适合本地部署和快速推理,显存要求较低
  • 14B 高性能版:模型体积达 32GB+,效果更优,但需要更高显存
下面是相关模型权重和代码仓库:
目前 ComfyUI 已原生支持 Wan2.1 Fun InP 模型。在开始本篇教程之前,请更新你的 ComfyUI,确保你的版本在这个提交之后。
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

Wan2.1 Fun InP 工作流

1. 下载工作流

下载下面的图片,并将其拖入 ComfyUI 以加载工作流: Wan2.1 Fun InP 工作流

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“Wan 2.1 Inpainting”

起始图像

视频生成的起始帧。下载并使用此图像,或替换为你自己的图像。

结束图像

视频生成的结束帧。下载并使用此图像,或替换为你自己的图像。

2. 手动安装模型

如果自动下载模型无效,请手动下载模型并保存到对应的文件夹。 本指南涉及的全部模型都可以在 Wan_2.1_ComfyUI_repackagedWan2.1-Fun 中找到。 扩散模型:请选择 1.3B 或 14B。14B 版本的文件大小更大(32GB),对显存的要求也更高:

扩散模型:Wan2.1 Fun InP 1.3B

models/diffusion_models/wan2.1_fun_inp_1.3B_bf16.safetensors

扩散模型:Wan2.1 Fun InP 14B

models/diffusion_models/Wan2.1-Fun-14B-InP.safetensors(下载后重命名)
文本编码器:请选择以下模型之一(fp16 精度的文件大小更大,对性能要求更高):

文本编码器:umt5_xxl_fp16

models/text_encoders/umt5_xxl_fp16.safetensors

文本编码器:umt5_xxl_fp8

models/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
VAE

VAE:wan_2.1_vae

models/vae/wan_2.1_vae.safetensors
CLIP 视觉

CLIP 视觉:clip_vision_h

models/clip_vision/clip_vision_h.safetensors
文件保存位置:

3. 按步骤完成工作流

ComfyUI Wan2.1 Fun InP 视频生成工作流步骤图
  1. 确保 Load Diffusion Model 节点已加载 wan2.1_fun_inp_1.3B_bf16.safetensors
  2. 确保 Load CLIP 节点已加载 umt5_xxl_fp8_e4m3fn_scaled.safetensors
  3. 确保 Load VAE 节点已加载 wan_2.1_vae.safetensors
  4. 确保 Load CLIP Vision 节点已加载 clip_vision_h.safetensors
  5. 将起始帧上传到 Load Image 节点(已重命名为 Start_image
  6. 将结束帧上传到第二个 Load Image 节点
  7. (可选)修改提示词(中英文均支持)
  8. (可选)在 WanFunInpaintToVideo 中调整视频尺寸,避免使用过大的尺寸
  9. 点击 Run 按钮,或使用快捷键 Ctrl(cmd) + Enter 执行视频生成

4. 工作流说明

请确保使用正确的模型,因为 wan2.1_fun_inp_1.3B_bf16.safetensorswan2.1_fun_control_1.3B_bf16.safetensors 保存在同一文件夹中,且名称非常相似。请确认你使用的是正确的模型。
  • 使用 Wan Fun InP 时,你可能需要频繁修改提示词,以确保相应场景转换的准确性。

其它 Wan2.1 Fun Inp 或者视频相关自定义节点