For the complete documentation index, see llms.txt. This page is also available as Markdown.

LTX-2(音频 + 视频)

在 Clore.ai GPU 上使用 LTX-2 生成带原生音频的视频——拟音、环境声和口型同步。

LTX-2(2026年1月)是 Lightricks 的第二代视频基础模型,也是首个能够生成 与视频同步音频的模型 在一次前向传递中完成。它拥有 190 亿参数,能够生成带有拟音音效、环境音和口型同步语音的片段,而无需单独的音频模型。该架构继承了原始 LTX-Video 的速度优势,同时大幅扩展了能力。

在……上租用 GPU Clore.ai 是运行 19B 参数模型最实用的方式——无需购买一块 2,000 美元的 GPU,只需启动一台机器即可开始生成。

主要特性

  • 原生音频生成 ——拟音效果、环境氛围和口型同步对白与视频帧协同生成。

  • 190 亿参数 ——比 LTX-Video v1 大得多的 Transformer 主干,带来更清晰的细节和更连贯的运动。

  • 文本转视频 + 图像转视频 ——两种模态都支持音频输出。

  • 最高 720p 分辨率 ——比 v1 模型更高保真度的输出。

  • 联合音视频潜空间 ——统一的 VAE 同时编码视频和音频,保持它们在时间上的对齐。

  • 开源权重 ——以宽松许可证发布,可用于商业用途。

  • Diffusers 集成 ——与 Hugging Face diffusers 生态系统兼容。

需求

组件
最低
推荐

GPU 显存

16 GB(带卸载)

24+ GB

系统内存

32 GB

64 GB

磁盘

50 GB

80 GB

Python

3.10+

3.11

CUDA

12.8+

12.8+

diffusers

0.33+

最新

Clore.ai GPU 推荐: 一台 RTX 4090 (24 GB,$0.14–0.42/小时)是舒适地进行带音频的 720p 生成的最低配置。对于批量任务或更快的迭代,可筛选 双 4090A6000 (48 GB)在 Clore.ai 市场上的列表。

快速开始

使用示例

带音频的文本转视频

带口型同步音频的图像转视频

带拟音的环境场景

给 Clore.ai 用户的建议

  1. 明确描述声音 ——LTX-2 的音频分支会响应提示词中的音频线索。“噼啪作响的火焰”、“踩在碎石上的脚步声”、“人群低语”比含糊的描述更能生成更好的拟音。

  2. CPU 卸载至关重要 ——在 190 亿参数规模下,模型需要 enable_model_cpu_offload() 在 24 GB 显卡上运行。建议预留 64 GB 系统内存。

  3. 持久化存储 ——模型检查点约为 40 GB。挂载 Clore.ai 持久卷并设置 HF_HOME ,以避免每次容器重启都重新下载。

  4. 合并音频 + 视频 ——如果管线单独输出音频,可按以下方式合并: ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac final.mp4.

  5. 仅限 bf16 ——19B 模型采用 bf16 训练;fp16 会导致数值不稳定。

  6. 在 tmux 中批量运行 ——务必在 tmux 在 Clore.ai 租用的实例上,以避免 SSH 断开连接时中断。

  7. 检查模型 ID ——由于 LTX-2 刚刚发布(2026 年 1 月),请在 Lightricks 的 HF 页面 上确认准确的 Hugging Face 模型 ID 后再运行。

故障排查

问题
修复

OutOfMemoryError

启用 pipe.enable_model_cpu_offload();确保系统内存 ≥64 GB

输出中没有音频

音频生成可能需要显式标志或更新版 diffusers;请查看 model card 获取最新 API

音视频不同步

使用 ffmpeg 重新封装: ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac -shortest out.mp4

生成非常慢

19B 模型计算开销很大;在 RTX 4090 上每个 5 秒片段预计需要约 2–4 分钟。

输出 NaN

使用 torch.bfloat16 ——此模型规模不支持 fp16

磁盘空间错误

模型约为 40 GB;下载前请确保至少有 80 GB 可用磁盘空间

ModuleNotFoundError: soundfile

pip install soundfile ——用于导出 WAV 音频

最后更新于

这有帮助吗?