什么是 LTX 2.5?

LTX 2.5 是 Lightricks 视频生成模型继 LTX-2LTX 2.3 之后的新版本。

基本机制与 LTX 2.3 相同,不过它不只是让输出变得更漂亮,还带来了几项较大的改进。

  • Multi-shot
    • 一次生成多个镜头
  • Gemma 4 Text Encoder
    • Text Encoder 从 Gemma 3 改为 Gemma 4
  • Diffusion Decoder
    • 不再使用 VAE Decode,而是用扩散模型从 latent 还原视频
    • 思路和 PiD 比较接近

除此之外还有一些改进,不过如果是在 ComfyUI 中使用,暂时知道这些就够了。


推荐设置

  • 分辨率
    • 必须是 32 的倍数
  • FPS
    • 不限制为几个固定值
    • 默认值是 24 FPS
  • 帧数
    • 必须是 8n + 1
  • 视频最长长度
    • 481 帧
    • 24 FPS 时约为 20 秒

模型下载

📂ComfyUI/
└── 📂models/
    ├── 📂diffusion_models/
    │   └── ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
    ├── 📂latent_upscale_models/
    │   └── ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors
    ├── 📂text_encoders/
    │   └── gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
    └── 📂vae/
        ├── ltx-2.5-video-vae-bf16.safetensors
        └── ltx-2.5-audio-vae-bf16.safetensors

text2video

ltx_2_5_text2video.json

和 LTX-2 一样,这是一个 2 阶段工作流:先以目标分辨率的一半生成,再放大 2 倍。

分辨率设置

之后会放大 2 倍,所以在 EmptyLTXVLatentVideo 中输入目标分辨率一半的值。

这个值也必须是 32 的倍数,因此目标宽度和高度请设为 64 的倍数。

帧数设置

在这个工作流中,输入想要生成的视频秒数(sec)和 FPS 后,帧数会自动取整为合适的 8n + 1

输出示例

Multi-shot

从 Seedance 2 等模型开始,这种功能逐渐常见起来。现在一次生成就能制作多个镜头。

ltx_2_5_text2video_multishot.json

不需要特别的写法,只要用自然语言写出“这里切换镜头……”之类的内容,模型就会识别。

写起来很轻松,不过模型有时也不会将它识别为 Multi-shot。遇到这种情况,就耐心多试几次吧。

输出示例

Duration Predictor

视频长度基本上需要手动设置,不过要判断这段提示词究竟适合几秒,其实也挺让人纠结的。

LTX 2.5 可以根据提示词内容,自动推测表现这些内容所需的视频长度。

模型下载

📂ComfyUI/
└── 📂models/
    └── 📂model_patches/
        └── ltx-2.5-duration-head-bf16.safetensors
ltx_2_5_text2video_duration_predictor.json

LTXV Duration Predictor

节点会输出根据提示词预测的帧数,再连接到普通 text2video 工作流的 length

这毕竟只是预测,所以结果有时会比预期更短或更长。即便如此,能自动预测视频长度还是个挺有意思的功能。

image2video

ltx_2_5_image2video.json

用法和 LTX 2 的 image2video 相同。使用 LTXVImgToVideoInplace 将输入图像插入为第 1 帧。

以前出于各种原因,会使用 LTXV Preprocess 故意降低输入图像的质量。不过在 LTX 2.5 中,至少就我使用的情况来看似乎已经不再需要,所以这里将它去掉了。

输出示例

输入
输入
输出

Generative Interpolation / FLF2V

将任意数量的图像交给模型,让它流畅地填补图像之间的内容。

如果只指定视频的第一张和最后一张图像,就是通常所说的 FLF2V

ltx_2_5_generative_interpolation.json

LTXV Add Guide

frame_idx 中指定插入图像的位置。

  • 0:第一帧
  • -1:最后一帧

增加节点并依次连接起来,就能进行 Generative Interpolation。

根据图像的不同,结果有时不像补帧,反而更像转场。
对于插在中间的 LTXVAddGuide,可以尝试将 strength 降到 0.3~0.4 左右。

输出示例

输入 1
输入 1
输入 2
输入 2
输入 3
输入 3
输出

IC-LoRA

IC-LoRA 在 LTX 中的作用类似于 ControlNet 或视频编辑 LoRA。

LTX 2.5 与许多为 LTX 2.3 制作的 IC-LoRA 兼容,可以直接使用。

算上 LTX 2.3 用的模型,IC-LoRA 的种类非常多。这里先试试最基本的 Union Control。

模型下载

📂ComfyUI/
└── 📂models/
    └── 📂loras/
        └── ltx-2.3-22b-ic-lora-union-control-ref0.5.safetensors

IC-LoRA Union

和普通 ControlNet 一样,可以用线稿、深度图或姿势视频控制生成视频。

ltx_2_5_ic_lora_pose.json

关于 IC-LoRA 的详细说明,请参阅 LTX 2 / IC-LoRA (Pose)

输出示例

输入 / 姿势
输出

用作放大模型

LTX 2.5 采用 2 阶段结构:先以一半分辨率生成,再将分辨率放大 2 倍并重新整理画面。

既然如此,只使用第 2 阶段,把它当作任意视频的 2 倍放大模型也是很自然的想法。

ltx_2_5_x2_upscaler.json

这里只是对任意视频进行 VAE Encode,再接到前面一直使用的工作流第 2 阶段。

不过,如果继续使用前面的 ManualSigmas 数值,实际 denoise 会过强,原视频的变化也会太大。

这里改用 Basic Scheduler,并将 denoise 设为 0.3。请根据需要调整。

输出示例

输入
输出

虽然现在也出现了许多竞争模型,但它生成自然视频的能力仍然相当突出。希望大家能根据用途灵活使用不同的模型。