> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/videogenerierung/ltx-video-2.md).

# LTX-2 (Audio + Video)

Generiere Videos mit nativem Audio — Foley, Atmosphäre und Lippensynchronisation — mit LTX-2 auf Clore.ai-GPUs.

LTX-2 (Januar 2026) ist Lightricks' Video-Foundation-Modell der zweiten Generation und das erste Open-Weight-Modell, das **synchronisierten Ton zusammen mit dem Video** in einem einzigen Forward Pass. Mit 19 Mrd. Parametern erzeugt es Clips mit Foley-Soundeffekten, Umgebungsgeräuschen und lip-synchroner Sprache, ohne ein separates Audiomodell zu benötigen. Die Architektur baut auf dem Geschwindigkeitsvorteil des ursprünglichen LTX-Video auf und erweitert die Fähigkeiten drastisch.

Das Mieten einer GPU auf [Clore.ai](https://clore.ai/) ist der praktischste Weg, ein Modell mit 19 Mrd. Parametern auszuführen — kein Kauf einer GPU für 2.000 US-Dollar erforderlich, einfach eine Maschine starten und mit der Generierung beginnen.

## Hauptfunktionen

* **Native Audioerzeugung** — Foley-Effekte, Umgebungsatmosphäre und lip-synchroner Dialog, gemeinsam mit den Videoframes erzeugt.
* **19 Mrd. Parameter** — deutlich größeres Transformer-Backbone als LTX-Video v1, mit schärferen Details und kohärenterer Bewegung.
* **Text-zu-Video + Bild-zu-Video** — beide Modalitäten mit Audioausgabe unterstützt.
* **Bis zu 720p-Auflösung** — höhere Ausgabequalität als das v1-Modell.
* **Gemeinsamer audio-visueller Latentraum** — ein einheitliches VAE kodiert sowohl Video als auch Audio und hält sie zeitlich synchron.
* **Offene Gewichte** — unter einer freizügigen Lizenz für die kommerzielle Nutzung veröffentlicht.
* **Diffusers-Integration** — kompatibel mit dem Hugging Face `diffusers` Ökosystem.

## Anforderungen

| Komponente | Minimum                | Empfohlen  |
| ---------- | ---------------------- | ---------- |
| GPU-VRAM   | 16 GB (mit Offloading) | 24+ GB     |
| System-RAM | 32 GB                  | 64 GB      |
| Festplatte | 50 GB                  | 80 GB      |
| Python     | 3.10+                  | 3.11       |
| CUDA       | 12.8+                  | 12.8+      |
| diffusers  | 0.33+                  | aktuellste |

**Clore.ai-GPU-Empfehlung:** Ein **RTX 4090** (24 GB, 0,14–0,42 $/Std.) ist das Minimum für komfortable 720p-Generierung mit Audio. Für Batch-Workloads oder schnellere Iteration filtern Sie nach **dual-4090** oder **A6000** (48 GB)-Angeboten auf dem Clore.ai-Marktplatz.

## Schnellstart

```bash
# Abhängigkeiten installieren
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
pip install diffusers transformers accelerate sentencepiece
pip install imageio[ffmpeg] soundfile scipy

# GPU überprüfen
python -c "import torch; print(torch.cuda.get_device_name(0), torch.cuda.get_device_properties(0).total_mem // 1024**3, 'GB')"
```

## Anwendungsbeispiele

### Text-zu-Video mit Audio

```python
import torch
from diffusers import LTXPipeline
from diffusers.utils import export_to_video
import soundfile as sf

# LTX-2 laden (stellen Sie sicher, dass Sie bei der Veröffentlichung die korrekte Modell-ID haben)
pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video-2",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")
pipe.enable_model_cpu_offload()

prompt = (
    "Ein Schmied hämmert glühendes Metall auf einem Amboss, Funken fliegen, "
    "rhythmisches Klirren des Hammers auf Stahl, Umgebungsgeräusche der Werkstatt"
)

output = pipe(
    prompt=prompt,
    negative_prompt="still, verschwommen, geringe Qualität",
    num_frames=121,
    width=1280,
    height=720,
    num_inference_steps=40,
    guidance_scale=7.0,
    generator=torch.Generator("cuda").manual_seed(42),
)

# Videoframes exportieren
export_to_video(output.frames[0], "blacksmith.mp4", fps=24)

# Audio exportieren, falls verfügbar
if hasattr(output, "audio") and output.audio is not None:
    sf.write("blacksmith_audio.wav", output.audio, samplerate=16000)
    print("Audio separat gespeichert — mit ffmpeg muxen:")
    print("  ffmpeg -i blacksmith.mp4 -i blacksmith_audio.wav -c:v copy -c:a aac output.mp4")

print("Fertig: blacksmith.mp4")
```

### Bild-zu-Video mit Lip-Sync-Audio

```python
import torch
from PIL import Image
from diffusers import LTXImageToVideoPipeline
from diffusers.utils import export_to_video

pipe = LTXImageToVideoPipeline.from_pretrained(
    "Lightricks/LTX-Video-2",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")
pipe.enable_model_cpu_offload()

# Porträtbild für Lip-Sync
image = Image.open("portrait.png").resize((720, 1280))

output = pipe(
    prompt="Eine Person sagt 'Willkommen in der Zukunft des KI-Videos' mit klarer Aussprache, neutralem Hintergrund",
    image=image,
    num_frames=121,
    num_inference_steps=40,
    guidance_scale=7.0,
)

export_to_video(output.frames[0], "talking_head.mp4", fps=24)
```

### Atmosphärische Szene mit Foley

```python
import torch
from diffusers import LTXPipeline
from diffusers.utils import export_to_video

pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video-2", torch_dtype=torch.bfloat16
).to("cuda")

# Audio-reicher Prompt — Geräusche ausdrücklich beschreiben
prompt = (
    "Regen fällt auf ein Blechdach in einem tropischen Dorf, "
    "Donner grollt in der Ferne, Vögel zwitschern kurz zwischen den Grollen, "
    "Pfützen kräuseln sich auf einem unbefestigten Weg"
)

output = pipe(
    prompt=prompt,
    num_frames=121,
    width=1280,
    height=720,
    num_inference_steps=40,
    guidance_scale=6.5,
)

export_to_video(output.frames[0], "rain_scene.mp4", fps=24)
```

## Tipps für Clore.ai-Nutzer

1. **Geräusche ausdrücklich beschreiben** — der Audiozweig von LTX-2 reagiert auf Audiohinweise im Prompt. "Knistern des Feuers", "Schritte auf Kies", "Gemurmel der Menge" liefern besseres Foley als vage Beschreibungen.
2. **CPU-Offloading ist unerlässlich** — bei 19 Mrd. Parametern benötigt das Modell `enable_model_cpu_offload()` auf 24-GB-Karten. Planen Sie 64 GB Systemspeicher ein.
3. **Persistenter Speicher** — der Modell-Checkpoint ist \~40 GB groß. Hängen Sie ein persistentes Volume von Clore.ai ein und setzen Sie `HF_HOME` um erneutes Herunterladen bei jedem Container-Neustart zu vermeiden.
4. **Audio + Video muxen** — wenn die Pipeline Audio separat ausgibt, kombinieren Sie mit: `ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac final.mp4`.
5. **nur bf16** — das 19B-Modell wurde in bf16 trainiert; fp16 führt zu numerischer Instabilität.
6. **Batch in tmux** — immer innerhalb von `tmux` auf Clore.ai-Mietinstanzen, um SSH-Verbindungsabbrüche zu überstehen.
7. **Modell-ID prüfen** — da LTX-2 frisch veröffentlicht wurde (Jan. 2026), überprüfen Sie die genaue HuggingFace-Modell-ID auf der [HuggingFace-Seite von Lightricks](https://huggingface.co/Lightricks) vor dem Ausführen.

## Fehlerbehebung

| Problem                          | Fix                                                                                                                                    |
| -------------------------------- | -------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError`               | Aktiviere `pipe.enable_model_cpu_offload()`; stellen Sie sicher, dass ≥64 GB Systemspeicher vorhanden sind                             |
| Kein Audio in der Ausgabe        | Die Audioerzeugung kann ein explizites Flag oder ein aktualisiertes diffusers erfordern; prüfen Sie die Model Card für die neueste API |
| Audio-/Video-Desynchronisation   | Erneut mit ffmpeg muxen: `ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac -shortest out.mp4`                                       |
| Sehr langsame Generierung        | Das 19B-Modell ist rechenintensiv; \~2–4 Min. pro 5-Sek.-Clip auf einer RTX 4090 sind zu erwarten                                      |
| NaN-Ausgaben                     | Verwende `torch.bfloat16` — fp16 wird für diese Modellgröße nicht unterstützt                                                          |
| Fehler wegen Speicherplatz       | Das Modell ist \~40 GB groß; stellen Sie vor dem Herunterladen ≥80 GB freien Speicherplatz sicher                                      |
| `ModuleNotFoundError: soundfile` | `pip install soundfile` — für den WAV-Audioexport erforderlich                                                                         |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/videogenerierung/ltx-video-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
