LTX-2 视频生成模型
一句话简介
Lightricks 开源的 Python 项目,专注于 AI 视频生成与处理,提供高效的视频创作、编辑与转换工具。
标签
适用应用场景
- AI 视频内容生成
- 视频编辑与后期处理
- 多媒体内容创作自动化
- 视频风格转换与特效
README 中文摘要
LTX-2 模型概述
LTX-2 是首个基于 DiT 架构的音视频联合生成基础模型,单一模型整合了现代视频生成的核心能力:音视频同步、高保真画质、多种性能模式、可用于生产环境的输出、API 接口以及开源访问。
项目结构
仓库采用 monorepo 形式组织,包含三个主要子包:
- ltx-core:核心模型实现、推理栈与工具函数
- ltx-pipelines:高层 Pipeline 实现,覆盖文生视频、图生视频等生成模式
- ltx-trainer:训练与微调工具,支持 LoRA、全量微调以及 IC-LoRA
每个子包均附带独立的 README 与详细文档。
快速开始
克隆仓库并安装依赖:
git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
uv sync --extra natten
natten 额外项是扩散 VAE 解码最快的后端,仅支持 Linux + CUDA;在 Windows 与 macOS 上会自动跳过,回退到 Triton 或 eager 实现,因此同一命令可在所有平台运行。
使用 Hugging Face CLI 登录并下载模型(约 66 GiB):
hf auth login
hf download Lightricks/LTX-2.5 \
diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
vae/ltx-2.5-video-vae-bf16.safetensors \
vae/ltx-2.5-audio-vae-bf16.safetensors \
latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
--local-dir models/ltx-2.5
若遇到 401/403 错误,需在 Hugging Face 上接受模型许可并使用具有「读访问受限仓库」权限的 Token。
执行推理生成视频:
uv run python -m ltx_pipelines.distilled \
--transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
--text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
--video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
--audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
--spatial-upsampler-path models/ltx-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
--num-frames 121 \
--seed 42 \
--output-path output.mp4 \
--prompt "..."
GPU 显存不足时可附加 --quantization fp8-cast --offload {cpu, disk}。
模型组件
LTX-2.5 推荐作为默认版本,权重按组件分别发布,可按需下载:
- Transformer:
ltx-2.5-22b-dev-transformer-bf16.safetensors(全量模型,用于两阶段引导 Pipeline)和ltx-2.5-22b-distilled-transformer-bf16.safetensors(蒸馏版,步数大幅减少) - 文本编码器:Gemma 4 12B,已针对 LTX 微调并内置文本投影头;加载时会校验编码器版本(
gemma4-12b-ltx-v1),不可替换为原版 Gemma - 视频 VAE:
ltx-2.5-video-vae-bf16(扩散解码器,画质更优、显存占用更高)与ltx-2.5-video-vae-conv-bf16(卷积解码器,更轻量) - 音频 VAE:用于生成或解码音频的 Pipeline
- 空间 / 时间上采样器:分别用于两阶段 Pipeline 与 DFRPipeline 的时空精修
- 蒸馏 LoRA:在两阶段 Pipeline 的阶段 1 中使用
- 细节 IC-LoRA:可选,用于 DFRPipeline 的 2x 空间细节精修
- Duration Head:可选,使时长由 Prompt 预测,无需手动指定
--num-frames
LTX-2.3 检查点为单文件形式(包含 Transformer、VAE 与文本投影),与 2.5 文件不可互换,LoRA 也仅能在对应基模型上使用。
可用 Pipeline
- DistilledPipeline:最快的推理方式,预定义 8 个 sigma 值(推荐)
- DFRPipeline:关键帧生成 + 空间细节精修,支持可选的 2x/4x 时序精修
- TI2VidTwoStagesPipeline:生产级文/图生视频,含 2x 上采样
- TI2VidTwoStagesHQPipeline:同上但使用
res_2s二阶采样器,步数更少、质量更优 - TI2VidOneStagePipeline:单阶段生成,适合快速原型验证
- ICLoraPipeline:视频转视频与图像转视频转换(基于蒸馏模型)
- KeyframeInterpolationPipeline:在关键帧图像之间插值
- A2VidPipelineTwoStage:以音频文件为条件生成视频
- RetakePipeline:对已有视频的指定时间段重新生成
- HDRICLoraPipeline:视频转视频并输出 HDR(通过 LogC3 反向解码得到线性 float,适合 EXR 导出与色调映射)
- DubItPipeline:保留说话人身份与口型的重新配音
- 原生 HDR / EXR:标准 Pipeline 支持
--hdr {SRGB_LINEAR,ACESCG,ACESCCT}输入与 BT.2020/HLG 主文件输出
性能优化建议
- 优先使用 DistilledPipeline,阶段 1 仅需 8 步、阶段 2 4 步
- 启用 FP8 量化(
--quantization fp8-cast)降低显存占用;Hopper+ GPU 可使用--quantization fp8-scaled-mm(需 fp8 检查点) - 在 Blackwell(B200)上手动安装
flash-attn-4==4.0.0b9(针对 torch 2.9.1+cu128 验证),Hopper 安装 FlashAttention 3,其他 CUDA GPU 由 PyTorch SDPA 自动接管 - 通过梯度估计将去噪步数从 40 降至 20–30
- 显存充裕时可禁用阶段间的自动显存清理
- 快速原型阶段可使用
TI2VidOneStagePipeline
Prompt 编写建议
采用单段连贯、按时间顺序的镜头描述,包含具体动作、外貌、镜头角度与环境细节,总字数控制在 200 词以内。结构上建议:以主要动作开题 → 补充动作与手势 → 描述角色与物体外观 → 补充背景与环境 → 指定镜头角度与运动 → 描绘光影色彩 → 标注突变事件。Pipeline 支持 enhance_prompt 参数实现自动提示增强。
ComfyUI 集成
通过 https://github.com/Lightricks/ComfyUI-LTXVideo/ 仓库即可在 ComfyUI 中加载该模型。
摘要更新于 2026-08-13 00:32:04
· 原文 17166 字符
· md5 0f31c738686c…