Skip to main content
LTX-2.3 是 Lightricks 开源音视频生成模型的最新进化版本,现已原生支持 ComfyUI。在 LTX-2 的基础上,此版本在精细细节、人像视频、音频质量、图像到视频的一致性、提示理解和文本渲染方面带来了重大质量提升。 ComfyUI 为 LTX-2.3 提供了六个原生工作流,每个针对特定的生成模式:
  • 文本转视频 (T2V):根据文本提示生成视频
  • 图像转视频 (I2V):根据输入图像生成视频
  • FLF2V:在起始和结束图像之间进行插值
  • 图像音频转视频 (IA2V):从图像和音频生成唇形同步视频
  • IC-LoRA 联合控制:使用深度、姿态或边缘引导控制视频生成
  • ID-LoRA:从参考图像和音频片段生成带同步音频的个性化视频
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在 ComfyUI 的工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新开发版(nightly)。
  2. 启动时有些节点导入失败。

主要特性

  • 更精细的细节:新的潜在空间和更新的 VAE,带来更清晰的纹理、更干净的边缘和更精确的视觉效果
  • 9:16 竖屏支持:大幅提升竖屏人像视频的质量
  • 更优质的音频:更清晰的声音,减少噪音并增强对话效果
  • 改进的图像转视频:更一致的动态和更少的伪影
  • 更智能的提示理解:改进的文本编码器,实现更准确的语义理解
  • 原生 ComfyUI 支持:所有工作流内置,无需自定义节点

快速开始

LTX-2.3 已原生支持 ComfyUI。要开始使用:
  1. 将 ComfyUI 更新到最新版本
  2. 转到 模板库 > 视频 > 选择任意 LTX-2.3 工作流
  3. 按照弹窗提示下载模型并运行工作流

ComfyUI 原生工作流

LTX-2.3 文本转视频 (T2V)

通过改进的提示理解和文本渲染,根据文本提示生成视频。

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”LTX-2.3 T2V”

模型下载

检查点:ltx-2.3-22b-dev-fp8

放置到 ComfyUI/models/checkpoints/

LoRA:蒸馏版 1.1

放置到 ComfyUI/models/loras/

LoRA:gemma 去审查版

放置到 ComfyUI/models/loras/

文本编码器:gemma 12B

放置到 ComfyUI/models/text_encoders/

超分器:空间 x2

放置到 ComfyUI/models/latent_upscale_models/

模型存储

提示技巧

  1. 核心动作:按时间顺序描述事件和动作
  2. 视觉细节:描述视频中所有希望出现的视觉细节
  3. 音频:描述场景所需的音效和对话

LTX-2.3 图像转视频 (I2V)

根据输入图像生成视频,具有更一致的动态和更流畅的动画。

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”LTX-2.3 I2V”

输入图像:egyptian_queen.png

下载默认输入图像,或使用您自己的图像。

模型下载

I2V 工作流使用与文本转视频相同的模型集。

检查点:ltx-2.3-22b-dev-fp8

放置到 ComfyUI/models/checkpoints/

LoRA:蒸馏版 1.1

放置到 ComfyUI/models/loras/

LoRA:gemma 去审查版

放置到 ComfyUI/models/loras/

文本编码器:gemma 12B

放置到 ComfyUI/models/text_encoders/

超分器:空间 x2

放置到 ComfyUI/models/latent_upscale_models/

模型存储


LTX-2.3 FLF2V

在起始图像和结束图像之间进行插值,生成流畅的视频过渡。

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”LTX-2.3 FLF2V”

起始图像:high_view_classic_car.png

视频的第一帧。

结束图像:low_view_classic_car.png

视频的最后一帧。

模型下载

FLF2V 工作流使用蒸馏版检查点而非开发版检查点。

检查点:ltx-2.3-22b-distilled-fp8

放置到 ComfyUI/models/checkpoints/

文本编码器:gemma 12B

放置到 ComfyUI/models/text_encoders/

模型存储


LTX-2.3 图像音频转视频 (IA2V)

上传图像和音频文件,生成具有同步唇部运动的高质量视频。

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”LTX-2.3 IA2V”

输入图像:cactus_man.png

说话角色的参考图像。

参考音频:ltx_23_audio.mp3

用于唇形同步的音频轨道。

模型下载

IA2V 工作流使用与文本转视频相同的模型集。

检查点:ltx-2.3-22b-dev-fp8

放置到 ComfyUI/models/checkpoints/

LoRA:蒸馏版 1.1

放置到 ComfyUI/models/loras/

LoRA:gemma 去审查版

放置到 ComfyUI/models/loras/

文本编码器:gemma 12B

放置到 ComfyUI/models/text_encoders/

超分器:空间 x2

放置到 ComfyUI/models/latent_upscale_models/

模型存储


LTX-2.3 IC-LoRA 联合控制

使用 IC-LoRA 结合对齐的控制输入(如深度、姿态或边缘)生成 LTX-2.3 视频。IC-LoRA 是基于 LTX-2.3 训练的情境内 LoRA,通过参考视频应用结构引导。它接受来自多种预处理器的控制信号,包括深度图、Canny 边缘和姿态骨架。此工作流使用子图实现模块化处理。 LTX-2.3 IC-LoRA 预览

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”LTX-2.3 IC-LoRA”

了解子图

此工作流使用子图节点实现模块化处理。查阅子图文档,了解如何自定义和扩展工作流。

输入素材

控制视频:stone_ruins.mp4

用于控制信号提取的驱动视频。

参考图像:the_forgotten_gate.png

用于风格和内容的参考图像。

模型下载

检查点:ltx-2.3-22b-distilled-fp8

放置到 ComfyUI/models/checkpoints/

LoRA:IC-LoRA 联合控制

放置到 ComfyUI/models/loras/

LoRA:gemma 去审查版

放置到 ComfyUI/models/loras/

文本编码器:gemma 12B

放置到 ComfyUI/models/text_encoders/

几何估计:MoGe Normal

放置到 ComfyUI/models/geometry_estimation/

模型存储


LTX-2.3 ID-LoRA

根据文本提示、参考图像和短音频片段,生成带同步音频的个性化视频。使用 ID-LoRA 在单个生成模型中适应人物的外貌和声音。

在 Comfy Cloud 中运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”LTX-2.3 ID-LoRA”

参考图像:vintage_thinker.png

角色外观的参考图像。

参考音频:ltx23_reference_audio.mp3

用于声音克隆和唇形同步的音频片段。

模型下载

检查点:ltx-2.3-22b-dev-fp8

放置到 ComfyUI/models/checkpoints/

LoRA:蒸馏版 1.1

放置到 ComfyUI/models/loras/

LoRA:ID-LoRA TalkVid

放置到 ComfyUI/models/loras/

文本编码器:gemma 12B

放置到 ComfyUI/models/text_encoders/

超分器:空间 x2

放置到 ComfyUI/models/latent_upscale_models/

模型存储

提示技巧

为 LTX-2.3 编写提示时,重点使用详细的、按时间顺序描述的动作和场景:
  1. 核心动作:按时间顺序描述事件和动作
  2. 视觉细节:描述视频中所有希望出现的视觉细节
  3. 音频:描述场景所需的音效和对话

资源