关键能力
- 长达30秒:单次生成具有连贯动作和音频的长片段
- 原生音频:默认情况下,每个输出都包含同步音频轨道
- 文本、图像和参考输入:纯文本提示词、首帧动画,或最多10张参考图像、5个参考视频和5个参考音频片段
- 参考标签:直接在提示词中提及连接式媒体,如
@Image1、@Video1或@Audio1 - 灵活的输出:480p、720p 或 1080p 分辨率,支持自适应、16:9、9:16、1:1、4:3 或 3:4 宽高比
- 双语提示词:支持英语或中文提示
Wan万相 3.0 文生视频工作流
仅凭文本提示词即可生成视频,默认包含同步音频。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“Wan 3.0”
提示词技巧
- 时长:可设置为 2 到 30 秒,或设为
auto,让模型自行选择符合提示词的时长 - 分辨率与比例:工作流默认以 720p 输出并使用
adaptive比例;如需特定格式,可切换到 1080p 或固定比例(如16:9) - 音频:音频默认生成。关闭
audio选项即可生成静音视频 - 提示词扩展:提示词增强默认开启,会重写你的提示词以获得更佳效果。如需精确措辞,可在高级设置中将其关闭
Wan 3.0 图生视频工作流
将单张图像动画化为视频,并可选择指定一个末帧作为输出的过渡目标。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“Wan 3.0”
提示词技巧
- 首帧:
first_frame输入为必填项。last_frame输入为可选项,模型会生成两者之间的运动 - 自适应比例:使用
adaptive时,输出尺寸将跟随输入图像 - 提示词:描述哪些元素如何运动,以及你想要的音频。除非你希望模型改变主体和构图,否则请保持它们不变
Wan 3.0 参考生视频工作流
以参考图像、视频和音频为条件生成视频,每个参考素材通过提示词中的标签分配职责。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“Wan 3.0”
提示词技巧
- 通过标签引用:在提示词中以
@Image1、@Video1或@Audio1引用每个输入,按类型分别以输入顺序编号。示例提示词将鞋子设计分配给@Image1,将角色分配给@Image2 - 限制:最多 10 张参考图像、5 个参考视频和 5 个参考音频片段。每个参考视频或音频片段不得超过 15 秒,且所有参考视频的合计时长也须保持在 15 秒以内(音频同理)。参考视频与输出的总时长不得超过 30 秒
- 分配职责:明确说明每个参考素材控制什么(产品设计、角色身份、风格、动作、声音)以及必须保持不变的部分。明确的职责分配能产生更一致的结果
- 必须提供提示词或参考:请提供提示词或至少一个参考输入,否则节点将返回错误
开始使用
- 将 ComfyUI 更新为最新版本,或使用最新的 Comfy Desktop
- 前往模板库,搜索
Wan 3.0 - 加载三个工作流之一(文生视频、图生视频或参考生视频)
- 使用你的 Comfy 账户登录,并确保你有足够的积分
- 连接输入素材(首帧或参考图像)并运行
常见问题
什么是 Wan 3.0?
什么是 Wan 3.0?
Wan 3.0 是阿里巴巴的最新视频生成模型,可在 ComfyUI 中通过合作节点使用。它可单次生成最长 30 秒的视频并同步生成音频,还支持文本提示、参考图像、参考视频和参考音频。
Wan 3.0 可以生成多长的视频?
Wan 3.0 可以生成多长的视频?
每个片段最长 30 秒。时长输入支持 2 至 30 秒,或输入
auto 让模型选择符合提示的时长。Wan 3.0 会生成音频吗?
Wan 3.0 会生成音频吗?
会。默认情况下,每个输出都会包含一条同步音频轨道,对白、音效和音乐会与视频一起生成。如需静音视频,请关闭
audio 选项。Wan 3.0 可以使用参考图像、视频或音频吗?
Wan 3.0 可以使用参考图像、视频或音频吗?
可以,在参考生视频工作流中支持。最多可连接 10 张参考图像、5 个参考视频和 5 个参考音频片段,然后在提示中以
@Image1、@Video1 或 @Audio1 的形式引用它们。Wan 3.0 与 Wan 2.7 有什么区别?
Wan 3.0 与 Wan 2.7 有什么区别?
Wan 3.0 是阿里巴巴视频模型的最新一代。它扩展了多模态流水线,支持图像、视频和音频的参考标签,默认生成原生同步音频,并且每个片段最多可输出 30 秒。上一个版本请参阅 Wan 2.7 页面。
Wan 3.0 支持中文提示吗?
Wan 3.0 支持中文提示吗?
支持。提示输入支持英文和中文。