- 文本转视频 (T2V):根据文本提示生成视频
- 图像转视频 (I2V):根据输入图像生成视频
- FLF2V:在起始和结束图像之间进行插值
- 图像音频转视频 (IA2V):从图像和音频生成唇形同步视频
- IC-LoRA 联合控制:使用深度、姿态或边缘引导控制视频生成
- ID-LoRA:从参考图像和音频片段生成带同步音频的个性化视频
主要特性
- 更精细的细节:新的潜在空间和更新的 VAE,带来更清晰的纹理、更干净的边缘和更精确的视觉效果
- 9:16 竖屏支持:大幅提升竖屏人像视频的质量
- 更优质的音频:更清晰的声音,减少噪音并增强对话效果
- 改进的图像转视频:更一致的动态和更少的伪影
- 更智能的提示理解:改进的文本编码器,实现更准确的语义理解
- 原生 ComfyUI 支持:所有工作流内置,无需自定义节点
快速开始
LTX-2.3 已原生支持 ComfyUI。要开始使用:- 将 ComfyUI 更新到最新版本
- 转到 模板库 > 视频 > 选择任意 LTX-2.3 工作流
- 按照弹窗提示下载模型并运行工作流
ComfyUI 原生工作流
LTX-2.3 文本转视频 (T2V)
通过改进的提示理解和文本渲染,根据文本提示生成视频。在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”LTX-2.3 T2V”
模型下载
检查点:ltx-2.3-22b-dev-fp8
放置到
ComfyUI/models/checkpoints/LoRA:蒸馏版 1.1
放置到
ComfyUI/models/loras/LoRA:gemma 去审查版
放置到
ComfyUI/models/loras/文本编码器:gemma 12B
放置到
ComfyUI/models/text_encoders/超分器:空间 x2
放置到
ComfyUI/models/latent_upscale_models/模型存储
提示技巧
- 核心动作:按时间顺序描述事件和动作
- 视觉细节:描述视频中所有希望出现的视觉细节
- 音频:描述场景所需的音效和对话
LTX-2.3 图像转视频 (I2V)
根据输入图像生成视频,具有更一致的动态和更流畅的动画。在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”LTX-2.3 I2V”
输入图像:egyptian_queen.png
下载默认输入图像,或使用您自己的图像。
模型下载
I2V 工作流使用与文本转视频相同的模型集。检查点:ltx-2.3-22b-dev-fp8
放置到
ComfyUI/models/checkpoints/LoRA:蒸馏版 1.1
放置到
ComfyUI/models/loras/LoRA:gemma 去审查版
放置到
ComfyUI/models/loras/文本编码器:gemma 12B
放置到
ComfyUI/models/text_encoders/超分器:空间 x2
放置到
ComfyUI/models/latent_upscale_models/模型存储
LTX-2.3 FLF2V
在起始图像和结束图像之间进行插值,生成流畅的视频过渡。在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”LTX-2.3 FLF2V”
起始图像:high_view_classic_car.png
视频的第一帧。
结束图像:low_view_classic_car.png
视频的最后一帧。
模型下载
FLF2V 工作流使用蒸馏版检查点而非开发版检查点。检查点:ltx-2.3-22b-distilled-fp8
放置到
ComfyUI/models/checkpoints/文本编码器:gemma 12B
放置到
ComfyUI/models/text_encoders/模型存储
LTX-2.3 图像音频转视频 (IA2V)
上传图像和音频文件,生成具有同步唇部运动的高质量视频。在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”LTX-2.3 IA2V”
输入图像:cactus_man.png
说话角色的参考图像。
参考音频:ltx_23_audio.mp3
用于唇形同步的音频轨道。
模型下载
IA2V 工作流使用与文本转视频相同的模型集。检查点:ltx-2.3-22b-dev-fp8
放置到
ComfyUI/models/checkpoints/LoRA:蒸馏版 1.1
放置到
ComfyUI/models/loras/LoRA:gemma 去审查版
放置到
ComfyUI/models/loras/文本编码器:gemma 12B
放置到
ComfyUI/models/text_encoders/超分器:空间 x2
放置到
ComfyUI/models/latent_upscale_models/模型存储
LTX-2.3 IC-LoRA 联合控制
使用 IC-LoRA 结合对齐的控制输入(如深度、姿态或边缘)生成 LTX-2.3 视频。IC-LoRA 是基于 LTX-2.3 训练的情境内 LoRA,通过参考视频应用结构引导。它接受来自多种预处理器的控制信号,包括深度图、Canny 边缘和姿态骨架。此工作流使用子图实现模块化处理。
在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”LTX-2.3 IC-LoRA”
了解子图
此工作流使用子图节点实现模块化处理。查阅子图文档,了解如何自定义和扩展工作流。
输入素材
控制视频:stone_ruins.mp4
用于控制信号提取的驱动视频。
参考图像:the_forgotten_gate.png
用于风格和内容的参考图像。
模型下载
检查点:ltx-2.3-22b-distilled-fp8
放置到
ComfyUI/models/checkpoints/LoRA:IC-LoRA 联合控制
放置到
ComfyUI/models/loras/LoRA:gemma 去审查版
放置到
ComfyUI/models/loras/文本编码器:gemma 12B
放置到
ComfyUI/models/text_encoders/几何估计:MoGe Normal
放置到
ComfyUI/models/geometry_estimation/模型存储
LTX-2.3 ID-LoRA
根据文本提示、参考图像和短音频片段,生成带同步音频的个性化视频。使用 ID-LoRA 在单个生成模型中适应人物的外貌和声音。在 Comfy Cloud 中运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索”LTX-2.3 ID-LoRA”
参考图像:vintage_thinker.png
角色外观的参考图像。
参考音频:ltx23_reference_audio.mp3
用于声音克隆和唇形同步的音频片段。
模型下载
检查点:ltx-2.3-22b-dev-fp8
放置到
ComfyUI/models/checkpoints/LoRA:蒸馏版 1.1
放置到
ComfyUI/models/loras/LoRA:ID-LoRA TalkVid
放置到
ComfyUI/models/loras/文本编码器:gemma 12B
放置到
ComfyUI/models/text_encoders/超分器:空间 x2
放置到
ComfyUI/models/latent_upscale_models/模型存储
提示技巧
为 LTX-2.3 编写提示时,重点使用详细的、按时间顺序描述的动作和场景:- 核心动作:按时间顺序描述事件和动作
- 视觉细节:描述视频中所有希望出现的视觉细节
- 音频:描述场景所需的音效和对话