Skip to main content
Cosmos-Predict2 是由 NVIDIA 推出的新一代物理世界基础模型,专为物理 AI 场景下的高质量视觉生成与预测任务设计。 该模型具备极高的物理准确性、环境交互性和细节还原能力,能够真实模拟复杂的物理现象与动态场景。 Cosmos-Predict2 支持多种生成方式,包括文本到图像(Text2Image)和视频到世界(Video2World), 广泛应用于工业仿真、自动驾驶、城市规划、科学研究等领域。 它是推动智能视觉与物理世界深度融合的关键基础工具。

GitHub

Cosmos-Predict2 源代码与文档

Hugging Face

Cosmos-Predict2 模型合集
本指南将引导你在 ComfyUI 中完成 视频到世界(Video2World) 的生成。 文生图部分请参考以下内容:

Cosmos Predict2 文生图

使用 Cosmos-Predict2 进行文生图生成

在 Comfy Cloud 上运行

在 Comfy Cloud 上使用强大的 GPU 运行 Cosmos-Predict2 工作流
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

Cosmos Predict2 视频到世界工作流

测试 2B 版本时,大约占用 16GB 显存。

1. 工作流文件

请下载下方视频并将其拖入 ComfyUI 以加载工作流。该工作流已嵌入模型下载链接。

在 Comfy Cloud 上运行

在 Comfy Cloud 上运行此工作流,模型已预装

下载工作流文件

下载 JSON 格式的工作流文件
请下载以下图片作为输入: 输入图像

2. 手动模型安装

如果模型下载未成功,可以在此部分尝试手动下载。 扩散模型

扩散模型

cosmos_predict2_2B_video2world_480p_16fps.safetensors
其他权重请访问 Cosmos_Predict2_repackaged 下载。 文本编码器

文本编码器

oldt5_xxl_fp8_e4m3fn_scaled.safetensors
VAE

VAE

wan_2.1_vae.safetensors
文件存放位置

3. 按步骤完成工作流

工作流步骤指南 请参照图片中的步骤顺序运行工作流:
  1. 确保 Load Diffusion Model 节点已加载 cosmos_predict2_2B_video2world_480p_16fps.safetensors
  2. 确保 Load CLIP 节点已加载 oldt5_xxl_fp8_e4m3fn_scaled.safetensors
  3. 确保 Load VAE 节点已加载 wan_2.1_vae.safetensors
  4. Load Image 节点中上传提供的输入图像
  5. (可选)如需首尾帧控制,使用快捷键 Ctrl(cmd) + B 启用尾帧输入
  6. (可选)可在 ClipTextEncode 节点中修改提示词
  7. (可选)在 CosmosPredict2ImageToVideoLatent 节点中修改尺寸和帧数
  8. 点击 Run 按钮,或使用快捷键 Ctrl(cmd) + Enter 运行工作流
  9. 生成完成后,视频会自动保存到 ComfyUI/output/ 目录,也可以在 save video 节点中预览