> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/generaciya-video/ltx-video-2.md).

# LTX-2 (аудио + видео)

LTX-2 (январь 2026) — это видеобазовая модель второго поколения от Lightricks и первая модель с открытыми весами, способная создавать **синхронизированное аудио вместе с видео** за один прямой проход. При 19 млрд параметров она генерирует клипы с шумами фоли, фоновой атмосферой и речью, синхронизированной по губам, без необходимости отдельной аудиомодели. Архитектура опирается на преимущество LTX-Video по скорости, при этом значительно расширяя возможности.

Аренда GPU на [Clore.ai](https://clore.ai/) — самый практичный способ запустить модель с 19 млрд параметров: не нужно покупать GPU за $2,000 — просто поднимите машину и начинайте генерировать.

## Ключевые особенности

* **Нативная генерация аудио** — эффекты фоли, окружающая атмосфера и диалоги, синхронизированные по губам, создаются совместно с видеокадрами.
* **19 млрд параметров** — значительно более крупный трансформерный backbone, чем у LTX-Video v1, обеспечивающий более чёткие детали и более согласованное движение.
* **Преобразование текста в видео + изображения в видео** — поддерживаются обе модальности с аудиовыходом.
* **Разрешение до 720p** — более высокое качество вывода, чем у модели v1.
* **Совместное аудиовизуальное латентное пространство** — единый VAE кодирует и видео, и аудио, сохраняя их временное выравнивание.
* **Открытые веса** — выпущена под разрешительной лицензией для коммерческого использования.
* **Интеграция с Diffusers** — совместима с экосистемой Hugging Face `diffusers` .

## Требования

| Компонент     | Минимум             | Рекомендуется    |
| ------------- | ------------------- | ---------------- |
| VRAM GPU      | 16 ГБ (с выгрузкой) | 24+ ГБ           |
| Системная RAM | 32 ГБ               | 64 ГБ            |
| Диск          | 50 ГБ               | 80 ГБ            |
| Python        | 3.10+               | 3.11             |
| CUDA          | 12.8+               | 12.8+            |
| diffusers     | 0.33+               | последняя версия |

**Рекомендация по GPU от Clore.ai:** Один **RTX 4090** (24 ГБ, $0.14–0.42/ч) — минимальный объём для комфортной генерации 720p с аудио. Для пакетной обработки или более быстрого итеративного цикла отфильтруйте **dual-4090** или **A6000** (48 ГБ) в объявлениях на маркетплейсе Clore.ai.

## Быстрый старт

```bash
# Установить зависимости
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
pip install diffusers transformers accelerate sentencepiece
pip install imageio[ffmpeg] soundfile scipy

# Проверить GPU
python -c "import torch; print(torch.cuda.get_device_name(0), torch.cuda.get_device_properties(0).total_mem // 1024**3, 'GB')"
```

## Примеры использования

### Текст в видео с аудио

```python
import torch
from diffusers import LTXPipeline
from diffusers.utils import export_to_video
import soundfile as sf

# Загрузите LTX-2 (убедитесь, что у вас правильный ID модели после выпуска)
pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video-2",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")
pipe.enable_model_cpu_offload()

prompt = (
    "Кузнец кует раскалённый металл на наковальне, искры летят, "
    "ритмичный звон молота о сталь, фоновый шум мастерской"
)

output = pipe(
    prompt=prompt,
    negative_prompt="без звука, размытый, низкое качество",
    num_frames=121,
    width=1280,
    height=720,
    num_inference_steps=40,
    guidance_scale=7.0,
    generator=torch.Generator("cuda").manual_seed(42),
)

# Экспортировать видеокадры
export_to_video(output.frames[0], "blacksmith.mp4", fps=24)

# Экспортировать аудио, если доступно
if hasattr(output, "audio") and output.audio is not None:
    sf.write("blacksmith_audio.wav", output.audio, samplerate=16000)
    print("Аудио сохранено отдельно — объедините с помощью ffmpeg:")
    print("  ffmpeg -i blacksmith.mp4 -i blacksmith_audio.wav -c:v copy -c:a aac output.mp4")

print("Готово: blacksmith.mp4")
```

### Изображение в видео с аудио, синхронизированным по губам

```python
import torch
from PIL import Image
from diffusers import LTXImageToVideoPipeline
from diffusers.utils import export_to_video

pipe = LTXImageToVideoPipeline.from_pretrained(
    "Lightricks/LTX-Video-2",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")
pipe.enable_model_cpu_offload()

# Портретное изображение для синхронизации по губам
image = Image.open("portrait.png").resize((720, 1280))

output = pipe(
    prompt="Человек говорит 'Добро пожаловать в будущее ИИ-видео' чётко и разборчиво, нейтральный фон",
    image=image,
    num_frames=121,
    num_inference_steps=40,
    guidance_scale=7.0,
)

export_to_video(output.frames[0], "talking_head.mp4", fps=24)
```

### Атмосферная сцена с фоли

```python
import torch
from diffusers import LTXPipeline
from diffusers.utils import export_to_video

pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video-2", torch_dtype=torch.bfloat16
).to("cuda")

# Аудионасыщенный промпт — явно опишите звуки
prompt = (
    "Дождь падает на жестяную крышу в тропической деревне, "
    "далёкий раскат грома, птицы ненадолго щебечут между раскатами, "
    "лужи рябят на грунтовой дороге"
)

output = pipe(
    prompt=prompt,
    num_frames=121,
    width=1280,
    height=720,
    num_inference_steps=40,
    guidance_scale=6.5,
)

export_to_video(output.frames[0], "rain_scene.mp4", fps=24)
```

## Советы для пользователей Clore.ai

1. **Опишите звуки явно** — аудиоветвь LTX-2 реагирует на аудиоподсказки в промпте. «Потрескивание огня», «шаги по гравию», «шум толпы» дают более качественный фоли, чем расплывчатые описания.
2. **Выгрузка на CPU обязательна** — при 19 млрд параметров модели требуется `enable_model_cpu_offload()` на картах 24 ГБ. Заложите 64 ГБ системной RAM.
3. **Постоянное хранилище** — контрольная точка модели занимает \~40 ГБ. Подключите постоянный том Clore.ai и задайте `HF_HOME` чтобы не скачивать заново при каждом перезапуске контейнера.
4. **Объединяйте аудио + видео** — если pipeline выводит аудио отдельно, объедините с помощью: `ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac final.mp4`.
5. **только bf16** — модель на 19 млрд параметров обучалась в bf16; fp16 вызовет численную нестабильность.
6. **Пакетная обработка в tmux** — всегда запускайте внутри `tmux` на арендах Clore.ai, чтобы переживать разрывы SSH.
7. **Проверьте ID модели** — поскольку LTX-2 только что выпущена (янв. 2026), проверьте точный ID модели на [странице Lightricks HF](https://huggingface.co/Lightricks) перед запуском.

## Устранение неполадок

| Проблема                               | Исправьте                                                                                                                         |
| -------------------------------------- | --------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError`                     | Включите `pipe.enable_model_cpu_offload()`; убедитесь, что доступно ≥64 ГБ системной RAM                                          |
| Аудио отсутствует в выводе             | Для генерации аудио может потребоваться явный флаг или обновлённый diffusers; проверьте карточку модели на предмет последнего API |
| Несинхронность аудио/видео             | Повторно объедините с ffmpeg: `ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac -shortest out.mp4`                             |
| Очень медленная генерация              | Модель на 19 млрд параметров очень требовательна к вычислениям; около 2–4 мин на клип длиной 5 сек на RTX 4090 — ожидаемо         |
| Выходы NaN                             | Используйте `torch.bfloat16` — fp16 не поддерживается для модели такого масштаба                                                  |
| Ошибка нехватки дискового пространства | Размер модели \~40 ГБ; перед загрузкой убедитесь, что свободно ≥80 ГБ диска                                                       |
| `ModuleNotFoundError: soundfile`       | `pip install soundfile` — необходимо для экспорта WAV-аудио                                                                       |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/generaciya-video/ltx-video-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
