LTX-2 视频生成模型

Lightricks/LTX-2 访问 GitHub ↗
🔤 Python ★ 9134 ⑂ 0 weekly #13 (+556) 抓取 2026-08-19

一句话简介

Lightricks 开源的 Python 项目,专注于 AI 视频生成与处理,提供高效的视频创作、编辑与转换工具。

标签

  • 视频生成
  • AI模型
  • Python
  • 多媒体处理
  • 开源工具

适用应用场景

  • AI 视频内容生成
  • 视频编辑与后期处理
  • 多媒体内容创作自动化
  • 视频风格转换与特效

README 中文摘要

LTX-2 模型概述

LTX-2 是首个基于 DiT 架构的音视频联合生成基础模型,单一模型整合了现代视频生成的核心能力:音视频同步、高保真画质、多种性能模式、可用于生产环境的输出、API 接口以及开源访问。

项目结构

仓库采用 monorepo 形式组织,包含三个主要子包:

  • ltx-core:核心模型实现、推理栈与工具函数
  • ltx-pipelines:高层 Pipeline 实现,覆盖文生视频、图生视频等生成模式
  • ltx-trainer:训练与微调工具,支持 LoRA、全量微调以及 IC-LoRA

每个子包均附带独立的 README 与详细文档。

快速开始

克隆仓库并安装依赖:

git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
uv sync --extra natten

natten 额外项是扩散 VAE 解码最快的后端,仅支持 Linux + CUDA;在 Windows 与 macOS 上会自动跳过,回退到 Triton 或 eager 实现,因此同一命令可在所有平台运行。

使用 Hugging Face CLI 登录并下载模型(约 66 GiB):

hf auth login
hf download Lightricks/LTX-2.5 \
    diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
    text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
    vae/ltx-2.5-video-vae-bf16.safetensors \
    vae/ltx-2.5-audio-vae-bf16.safetensors \
    latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
    --local-dir models/ltx-2.5

若遇到 401/403 错误,需在 Hugging Face 上接受模型许可并使用具有「读访问受限仓库」权限的 Token。

执行推理生成视频:

uv run python -m ltx_pipelines.distilled \
    --transformer-path       models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
    --text-encoder-path      models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
    --video-vae-path         models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
    --audio-vae-path         models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
    --spatial-upsampler-path models/ltx-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
    --num-frames 121 \
    --seed 42 \
    --output-path output.mp4 \
    --prompt "..."

GPU 显存不足时可附加 --quantization fp8-cast --offload {cpu, disk}

模型组件

LTX-2.5 推荐作为默认版本,权重按组件分别发布,可按需下载:

  • Transformerltx-2.5-22b-dev-transformer-bf16.safetensors(全量模型,用于两阶段引导 Pipeline)和 ltx-2.5-22b-distilled-transformer-bf16.safetensors(蒸馏版,步数大幅减少)
  • 文本编码器:Gemma 4 12B,已针对 LTX 微调并内置文本投影头;加载时会校验编码器版本(gemma4-12b-ltx-v1),不可替换为原版 Gemma
  • 视频 VAEltx-2.5-video-vae-bf16(扩散解码器,画质更优、显存占用更高)与 ltx-2.5-video-vae-conv-bf16(卷积解码器,更轻量)
  • 音频 VAE:用于生成或解码音频的 Pipeline
  • 空间 / 时间上采样器:分别用于两阶段 Pipeline 与 DFRPipeline 的时空精修
  • 蒸馏 LoRA:在两阶段 Pipeline 的阶段 1 中使用
  • 细节 IC-LoRA:可选,用于 DFRPipeline 的 2x 空间细节精修
  • Duration Head:可选,使时长由 Prompt 预测,无需手动指定 --num-frames

LTX-2.3 检查点为单文件形式(包含 Transformer、VAE 与文本投影),与 2.5 文件不可互换,LoRA 也仅能在对应基模型上使用。

可用 Pipeline

  • DistilledPipeline:最快的推理方式,预定义 8 个 sigma 值(推荐)
  • DFRPipeline:关键帧生成 + 空间细节精修,支持可选的 2x/4x 时序精修
  • TI2VidTwoStagesPipeline:生产级文/图生视频,含 2x 上采样
  • TI2VidTwoStagesHQPipeline:同上但使用 res_2s 二阶采样器,步数更少、质量更优
  • TI2VidOneStagePipeline:单阶段生成,适合快速原型验证
  • ICLoraPipeline:视频转视频与图像转视频转换(基于蒸馏模型)
  • KeyframeInterpolationPipeline:在关键帧图像之间插值
  • A2VidPipelineTwoStage:以音频文件为条件生成视频
  • RetakePipeline:对已有视频的指定时间段重新生成
  • HDRICLoraPipeline:视频转视频并输出 HDR(通过 LogC3 反向解码得到线性 float,适合 EXR 导出与色调映射)
  • DubItPipeline:保留说话人身份与口型的重新配音
  • 原生 HDR / EXR:标准 Pipeline 支持 --hdr {SRGB_LINEAR,ACESCG,ACESCCT} 输入与 BT.2020/HLG 主文件输出

性能优化建议

  • 优先使用 DistilledPipeline,阶段 1 仅需 8 步、阶段 2 4 步
  • 启用 FP8 量化(--quantization fp8-cast)降低显存占用;Hopper+ GPU 可使用 --quantization fp8-scaled-mm(需 fp8 检查点)
  • 在 Blackwell(B200)上手动安装 flash-attn-4==4.0.0b9(针对 torch 2.9.1+cu128 验证),Hopper 安装 FlashAttention 3,其他 CUDA GPU 由 PyTorch SDPA 自动接管
  • 通过梯度估计将去噪步数从 40 降至 20–30
  • 显存充裕时可禁用阶段间的自动显存清理
  • 快速原型阶段可使用 TI2VidOneStagePipeline

Prompt 编写建议

采用单段连贯、按时间顺序的镜头描述,包含具体动作、外貌、镜头角度与环境细节,总字数控制在 200 词以内。结构上建议:以主要动作开题 → 补充动作与手势 → 描述角色与物体外观 → 补充背景与环境 → 指定镜头角度与运动 → 描绘光影色彩 → 标注突变事件。Pipeline 支持 enhance_prompt 参数实现自动提示增强。

ComfyUI 集成

通过 https://github.com/Lightricks/ComfyUI-LTXVideo/ 仓库即可在 ComfyUI 中加载该模型。

摘要更新于 2026-08-13 00:32:04 · 原文 17166 字符 · md5 0f31c738686c…