Skip to main content
Wan万相 3.0 是阿里巴巴最新的视频生成模型,现可通过合作节点在 ComfyUI 中使用。它可以在单次生成中输出最长 30 秒的视频,并带有同步音频轨道,同时将文本提示与参考图像、视频和音频相结合,以实现一致的角色和场景。
使用 API 节点需要保证你已经正常登录,并在受许可的网络环境下使用,请参考API 节点总览部分文档来了解使用 API 节点的具体使用要求。
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

关键能力

  • 长达30秒:单次生成具有连贯动作和音频的长片段
  • 原生音频:默认情况下,每个输出都包含同步音频轨道
  • 文本、图像和参考输入:纯文本提示词、首帧动画,或最多10张参考图像、5个参考视频和5个参考音频片段
  • 参考标签:直接在提示词中提及连接式媒体,如 @Image1@Video1@Audio1
  • 灵活的输出:480p、720p 或 1080p 分辨率,支持自适应、16:9、9:16、1:1、4:3 或 3:4 宽高比
  • 双语提示词:支持英语或中文提示

Wan万相 3.0 文生视频工作流

仅凭文本提示词即可生成视频,默认包含同步音频。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“Wan 3.0”

提示词技巧

  1. 时长:可设置为 2 到 30 秒,或设为 auto,让模型自行选择符合提示词的时长
  2. 分辨率与比例:工作流默认以 720p 输出并使用 adaptive 比例;如需特定格式,可切换到 1080p 或固定比例(如 16:9
  3. 音频:音频默认生成。关闭 audio 选项即可生成静音视频
  4. 提示词扩展:提示词增强默认开启,会重写你的提示词以获得更佳效果。如需精确措辞,可在高级设置中将其关闭

Wan 3.0 图生视频工作流

将单张图像动画化为视频,并可选择指定一个末帧作为输出的过渡目标。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“Wan 3.0”

提示词技巧

  1. 首帧first_frame 输入为必填项。last_frame 输入为可选项,模型会生成两者之间的运动
  2. 自适应比例:使用 adaptive 时,输出尺寸将跟随输入图像
  3. 提示词:描述哪些元素如何运动,以及你想要的音频。除非你希望模型改变主体和构图,否则请保持它们不变

Wan 3.0 参考生视频工作流

以参考图像、视频和音频为条件生成视频,每个参考素材通过提示词中的标签分配职责。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“Wan 3.0”

提示词技巧

  1. 通过标签引用:在提示词中以 @Image1@Video1@Audio1 引用每个输入,按类型分别以输入顺序编号。示例提示词将鞋子设计分配给 @Image1,将角色分配给 @Image2
  2. 限制:最多 10 张参考图像、5 个参考视频和 5 个参考音频片段。每个参考视频或音频片段不得超过 15 秒,且所有参考视频的合计时长也须保持在 15 秒以内(音频同理)。参考视频与输出的总时长不得超过 30 秒
  3. 分配职责:明确说明每个参考素材控制什么(产品设计、角色身份、风格、动作、声音)以及必须保持不变的部分。明确的职责分配能产生更一致的结果
  4. 必须提供提示词或参考:请提供提示词或至少一个参考输入,否则节点将返回错误

开始使用

  1. 将 ComfyUI 更新为最新版本,或使用最新的 Comfy Desktop
  2. 前往模板库,搜索 Wan 3.0
  3. 加载三个工作流之一(文生视频、图生视频或参考生视频)
  4. 使用你的 Comfy 账户登录,并确保你有足够的积分
  5. 连接输入素材(首帧或参考图像)并运行

常见问题

Wan 3.0 是阿里巴巴的最新视频生成模型,可在 ComfyUI 中通过合作节点使用。它可单次生成最长 30 秒的视频并同步生成音频,还支持文本提示、参考图像、参考视频和参考音频。
每个片段最长 30 秒。时长输入支持 2 至 30 秒,或输入 auto 让模型选择符合提示的时长。
会。默认情况下,每个输出都会包含一条同步音频轨道,对白、音效和音乐会与视频一起生成。如需静音视频,请关闭 audio 选项。
可以,在参考生视频工作流中支持。最多可连接 10 张参考图像、5 个参考视频和 5 个参考音频片段,然后在提示中以 @Image1@Video1@Audio1 的形式引用它们。
Wan 3.0 是阿里巴巴视频模型的最新一代。它扩展了多模态流水线,支持图像、视频和音频的参考标签,默认生成原生同步音频,并且每个片段最多可输出 30 秒。上一个版本请参阅 Wan 2.7 页面
支持。提示输入支持英文和中文。