- 文生视频(T2V):根据文本提示词生成视频
- 图生视频(I2V):根据输入图像生成视频
- FLF2V:在首帧图像与末帧图像之间进行插值
主要功能
- 扩散保真渲染:关键帧优先生成,在高质量关键帧网格上构建每个场景,实现像素级画质
- 扩散视频解码器:快速运动下呈现更清晰的面部、可读的文本和更少的拖影
- 原生多镜头:一次生成即可产出多个连接式镜头,在镜头切换中保持角色、环境、光照、声音和风格一致
- Gemma 4 12B 文本编码器:在复杂提示词中保留多个主体、动作、光照、细节和相机方向
- 提示词增强器:一个轻量级模型,可将简短提示词扩展为丰富的电影级指令
- 自动时长:在扩散开始之前,根据所描述的动作预测正确的片段长度
- 原生 4K HDR:专为专业后期制作打造的高分辨率 HDR 输出,支持最高 50 FPS 的音频与视频同步
入门
ComfyUI 原生支持 LTX-2.5。开始使用:- 将 ComfyUI 更新到最新版本
- 前往 模板库 > 视频 > 选择任意 LTX-2.5 工作流
- 在 Hugging Face 上申请模型仓库的访问权限(见下文),然后按照弹出窗口提示下载模型并运行工作流
LTX-2.5 模型文件托管在 Hugging Face 上受控访问(gated)的 Lightricks/LTX-2.5 仓库中。打开仓库页面,接受模型许可协议,并等待访问申请获批后再下载模型。未获得访问权限时,模型下载会失败。
ComfyUI 原生工作流
LTX-2.5 文生视频 (T2V)
根据文本提示生成视频,可选择使用空间放大以获得更高分辨率。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“LTX-2.5 T2V”
模型下载
Diffusion 模型:ltx-2.5-22b-distilled-transformer-comfy-int8-convrot
放入
ComfyUI/models/diffusion_models/文本编码器:gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot
放入
ComfyUI/models/text_encoders/文本编码器:gemma4_e2b_it_bf16
放入
ComfyUI/models/text_encoders/VAE:ltx-2.5-video-vae-bf16
放入
ComfyUI/models/vae/VAE:ltx-2.5-audio-vae-bf16
放入
ComfyUI/models/vae/放大模型:ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0
放入
ComfyUI/models/latent_upscale_models/模型存储
提示词技巧
- 描述完整场景:用一段连贯的文字描述镜头类型、场景、动作、角色和相机移动
- 音频:描述场景所需的声音和对话;模型会与视频一同生成同步音频
- 使用提示词增强器:工作流会自动将简短提示词扩展为详细的电影级指令;写下简单的场景构思,剩下的交给增强器处理
LTX-2.5 图生视频 (I2V)
根据输入图像生成视频,模型以提供的第一帧为起点对场景进行动画处理。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON,或在模板库中搜索“LTX-2.5 I2V”
输入图像:neon_cyborg_portrait.png
下载默认输入图像,或使用你自己的图像。
模型下载
I2V 工作流使用的模型与文生视频相同。Diffusion Model:ltx-2.5-22b-distilled-transformer-comfy-int8-convrot
放入
ComfyUI/models/diffusion_models/文本编码器:gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot
放入
ComfyUI/models/text_encoders/文本编码器:gemma4_e2b_it_bf16
放入
ComfyUI/models/text_encoders/VAE:ltx-2.5-video-vae-bf16
放入
ComfyUI/models/vae/VAE:ltx-2.5-audio-vae-bf16
放入
ComfyUI/models/vae/Upscaler:ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0
放入
ComfyUI/models/latent_upscale_models/模型存储
提示技巧
- 描述接下来发生的事情:写出输入图像之后发生的运动、相机移动和声音;不要重复描述画面中已可见的内容
- 锚定第一帧:续写时使用类似“将提供的起始图像作为第一帧”的措辞
- 音频:描述场景中的对话和声音;模型会生成同步音频
LTX-2.5 FLF2V
在首帧图像和末帧图像之间生成视频,将两帧融合为单个动画序列。在 Comfy Cloud 上运行
在 Comfy Cloud 中打开
下载工作流
下载 JSON 或在模板库中搜索 “LTX-2.5 FLF2V”
首帧:robot_hand_back.png
视频的首帧。
末帧:robot_hand_energy.png
视频的末帧。
模型下载
FLF2V 工作流使用与文生视频相同的模型集,但不包含空间放大模型。Diffusion 模型:ltx-2.5-22b-distilled-transformer-comfy-int8-convrot
放到
ComfyUI/models/diffusion_models/文本编码器:gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot
放到
ComfyUI/models/text_encoders/文本编码器:gemma4_e2b_it_bf16
放到
ComfyUI/models/text_encoders/VAE:ltx-2.5-video-vae-bf16
放到
ComfyUI/models/vae/VAE:ltx-2.5-audio-vae-bf16
放到
ComfyUI/models/vae/模型存储
提示词技巧
- 描述过渡:写出两帧之间发生的内容,包括相机移动和音频
- 保持帧对齐:使用相同宽高比的图像以获得平滑的插值效果
- 音频:描述场景中的对话和声音;模型会生成同步的音频