
LTX-Video 实时视频生成从跑通第一个 Demo 到参数调优【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-VideoLTX-Video 是 Lightricks 开源的 DiTDiffusion Transformer实时视频生成模型默认规格为 1216×704 分辨率、30 FPS。蒸馏版模型相比非蒸馏版提速约 15 倍8 个采样步即可出片。这篇指南带你完成安装、跑通第一段图生视频并讲清楚模型选型与参数怎么调。安装最小配置并跑通第一次生成官方测试环境为 Python 3.10.5 CUDA 12.2PyTorch 要求 2.1.2 以上macOS 走 MPS测试版本为 PyTorch 2.3.0。git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video python -m venv env source env/bin/activate pip install -e .[inference]模型权重在首次运行时会按配置文件自动下载。新手建议先做图生视频i2v画面比纯文生视频更稳定仓库里 tests/utils/woman.jpeg 就有现成的测试图python inference.py --prompt A woman turns around and smiles \ --conditioning_media_paths ./tests/utils/woman.jpeg \ --conditioning_start_frames 0 --height 704 --width 1216 \ --num_frames 97 --seed 42 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml注意两个硬性约束帧数必须是 8 的倍数加 19、17、25、97……分辨率必须能被 32 整除。不满足时框架会自动填充再裁切但直接写对最省事。它为什么快蒸馏模型、多尺度两阶段与 Rectified Flow⚡蒸馏模型砍掉了 guidance 开销。非蒸馏模型每步要额外跑 classifier-free guidance 和时空 guidanceSTG而蒸馏版完全不需要这两者用 8 步官方推荐值甚至更少的步数就能完成采样官方给出的加速数据约为 15 倍。多尺度两阶段渲染。configs/ 下所有 0.9.8 配置都是pipeline_type: multi-scale第一遍在约 2/3 的尺度downscale_factor: 0.667上快速出粗略画面再用空间上采样器ltxv-spatial-upscaler-0.9.8放大 latent第二遍补齐细节。这是 1216×704 能跑得动而不是逐像素算 720p 的关键。调度与精度可选。调度器实现见 ltx_video/schedulers/rf.py支持 uniform、linear-quadratic、from_checkpoint 三种模式。另外官方提供 FP8 量化权重配置里precision: float8_e4m3fn在 Ada 及更新的架构上还有专用 FP8 内核可装显存占用进一步下降。最小显存配置怎么选2B 到 13B 的 FP8 对照显存档位推荐配置特点8GBltxv-2b-0.9.8-distilled-fp8.yaml参数量最小、速度最快细节略弱16–24GBltxv-13b-0.9.8-distilled-fp8.yaml速度与质量均衡适合快速迭代24GB 以上bf16ltxv-13b-0.9.8-dev.yaml质量最高30 步采样显存需求最大选择逻辑很简单显存不够就先换同名-fp8配置跑不动 13B 就降到 2B distilled。2B 和 13B 的蒸馏模型由同一基座蒸馏而来可以放进同一条多尺度流水线里混用先 2B 出草稿、再 13B 补质量是常见做法。社区还有 8-bit 优化版 LTX-VideoQ8在 RTX 40608GB上生成 720×480、121 帧不足一分钟可作为低显存参考。参数怎么调显存爆掉、guidance_scale 与约束条件遇到的问题处理方式CUDA out of memory优先切到同名-fp8.yaml其次降分辨率、减帧数社区 TeaCache 方案可再提速约 2 倍画面与提示词对不上guidance_scale用官方推荐的 3–3.5提示词按主体动作 → 运动细节 → 外观 → 背景 → 机位 → 光线的顺序写控制在 200 词内想要更高质量步数从 20–30 提到 40 以上蒸馏版则可开启 stochastic sampling想复刻某次结果记下 seed相同 seed 相同参数可复现构图与风格要延长已有视频把视频片段传给--conditioning_media_paths片段长度同样满足 8n1分辨率方面官方表示 720×1280 以下、257 帧以内的效果最好盲目拉高只增加耗时。提示词超过 120 词时可启用 prompt 增强enhance_prompt会自动扩写细节。适合做什么图生视频、多条件关键帧与长视频图生视频是最常用的入口给定首帧图片模型补出运动。多条件关键帧--conditioning_media_paths可以同时接收多张图片或多个视频片段用--conditioning_start_frames指定各自在成片中的目标帧位置每一项还能单独设条件强度默认 1.0。适合分镜式叙事、风格过渡这类需求。控制与长视频官方提供了 depth、pose、canny 三类 IC-LoRA 控制模型对深度图、骨架、边缘图做条件控制13B 蒸馏版支持最长 60 秒的视频生成兼容上述控制模型。仓库近期已宣布下一代 LTX-2音视频同步生成、原生 4K/50 FPS后续能力迭代主要迁移到该项目本文的 0.9.8 权重仍然可用。延伸源码模块入口与下一步流水线实现ltx_video/pipelines/多尺度两阶段逻辑和 CRF 压缩都在这里3D Transformerltx_video/models/transformers/因果 VAE 与 latent 上采样ltx_video/models/autoencoders/测试与配置校验tests/含 test_configs.py、test_vae.py完整参数清单直接跑python inference.py --help查看。官方建议追求输出质量时优先使用 ComfyUI 工作流官方配套仓库也可以经 Diffusers 以库的形式集成微调与训练在官方 Trainer 仓库中支持 2B/13B 全量及 LoRA 两种模式。【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考