> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/generation-video/ltx-video-2.md).

# LTX-2 (audio + vidéo)

Générez des vidéos avec audio natif — bruitages, ambiance et synchronisation labiale — grâce à LTX-2 sur les GPU Clore.ai.

LTX-2 (janvier 2026) est le modèle fondation vidéo de deuxième génération de Lightricks et le premier modèle à poids ouverts à produire **de l’audio synchronisé en même temps que la vidéo** en une seule passe avant. Avec 19 milliards de paramètres, il génère des clips avec des effets sonores de type foley, de l’audio ambiant et des dialogues synchronisés sur les lèvres sans nécessiter de modèle audio distinct. L’architecture s’appuie sur l’avantage de vitesse de LTX-Video original tout en élargissant considérablement les capacités.

Louer un GPU sur [Clore.ai](https://clore.ai/) est le moyen le plus pratique d’exécuter un modèle à 19 milliards de paramètres — pas besoin d’acheter un GPU à 2 000 $, il suffit de lancer une machine et de commencer à générer.

## Caractéristiques clés

* **Génération audio native** — effets foley, ambiance environnementale et dialogues synchronisés sur les lèvres produits conjointement avec les images vidéo.
* **19 milliards de paramètres** — colonne vertébrale de transformeur nettement plus grande que celle de LTX-Video v1, offrant des détails plus nets et un mouvement plus cohérent.
* **Texte-vers-vidéo + image-vers-vidéo** — les deux modalités sont prises en charge avec sortie audio.
* **Jusqu’à une résolution 720p** — une sortie de fidélité supérieure à celle du modèle v1.
* **Espace latent audio-visuel conjoint** — un VAE unifié encode à la fois la vidéo et l’audio, en les maintenant alignés temporellement.
* **Poids ouverts** — publié sous une licence permissive pour un usage commercial.
* **Intégration à Diffusers** — compatible avec l’écosystème Hugging Face `diffusers` écosystème.

## Exigences

| Composant   | Minimum                   | Recommandé       |
| ----------- | ------------------------- | ---------------- |
| VRAM GPU    | 16 Go (avec déchargement) | 24+ Go           |
| RAM système | 32 Go                     | 64 Go            |
| Disque      | 50 Go                     | 80 Go            |
| Python      | 3.10+                     | 3.11             |
| CUDA        | 12.8+                     | 12.8+            |
| diffusers   | 0.33+                     | dernière version |

**Recommandation de GPU Clore.ai :** Un **RTX 4090** (24 Go, 0,14–0,42 $/h) est le minimum pour une génération 720p confortable avec audio. Pour des traitements par lot ou une itération plus rapide, filtrez pour **double-4090** ou **A6000** (48 Go) sur le marché Clore.ai.

## Démarrage rapide

```bash
# Installer les dépendances
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
pip install diffusers transformers accelerate sentencepiece
pip install imageio[ffmpeg] soundfile scipy

# Vérifier le GPU
python -c "import torch; print(torch.cuda.get_device_name(0), torch.cuda.get_device_properties(0).total_mem // 1024**3, 'GB')"
```

## Exemples d'utilisation

### Texte-vers-vidéo avec audio

```python
import torch
from diffusers import LTXPipeline
from diffusers.utils import export_to_video
import soundfile as sf

# Charger LTX-2 (assurez-vous d’avoir le bon identifiant de modèle lorsqu’il sera publié)
pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video-2",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")
pipe.enable_model_cpu_offload()

prompt = (
    "Un forgeron martelant du métal incandescent sur une enclume, des étincelles jaillissant, "
    "cliquetis rythmé du marteau sur l’acier, bruit ambiant de l’atelier"
)

output = pipe(
    prompt=prompt,
    negative_prompt="silencieux, flou, basse qualité",
    num_frames=121,
    width=1280,
    height=720,
    num_inference_steps=40,
    guidance_scale=7.0,
    generator=torch.Generator("cuda").manual_seed(42),
)

# Exporter les images vidéo
export_to_video(output.frames[0], "blacksmith.mp4", fps=24)

# Exporter l’audio s’il est disponible
if hasattr(output, "audio") and output.audio is not None:
    sf.write("blacksmith_audio.wav", output.audio, samplerate=16000)
    print("Audio enregistré séparément — fusionnez avec ffmpeg :")
    print("  ffmpeg -i blacksmith.mp4 -i blacksmith_audio.wav -c:v copy -c:a aac output.mp4")

print("Terminé : blacksmith.mp4")
```

### Image-vers-vidéo avec audio de synchronisation labiale

```python
import torch
from PIL import Image
from diffusers import LTXImageToVideoPipeline
from diffusers.utils import export_to_video

pipe = LTXImageToVideoPipeline.from_pretrained(
    "Lightricks/LTX-Video-2",
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")
pipe.enable_model_cpu_offload()

# Image de portrait pour la synchronisation labiale
image = Image.open("portrait.png").resize((720, 1280))

output = pipe(
    prompt="Une personne disant 'Bienvenue dans le futur de la vidéo IA' avec une articulation claire, arrière-plan neutre",
    image=image,
    num_frames=121,
    num_inference_steps=40,
    guidance_scale=7.0,
)

export_to_video(output.frames[0], "talking_head.mp4", fps=24)
```

### Scène ambiante avec foley

```python
import torch
from diffusers import LTXPipeline
from diffusers.utils import export_to_video

pipe = LTXPipeline.from_pretrained(
    "Lightricks/LTX-Video-2", torch_dtype=torch.bfloat16
).to("cuda")

# Prompt riche en audio — décrivez explicitement les sons
prompt = (
    "La pluie tombant sur un toit en tôle dans un village tropical, "
    "le tonnerre grondant au loin, des oiseaux pépiant brièvement entre les grondements, "
    "des flaques ondulant sur un chemin de terre"
)

output = pipe(
    prompt=prompt,
    num_frames=121,
    width=1280,
    height=720,
    num_inference_steps=40,
    guidance_scale=6.5,
)

export_to_video(output.frames[0], "rain_scene.mp4", fps=24)
```

## Conseils pour les utilisateurs de Clore.ai

1. **Décrivez explicitement les sons** — la branche audio de LTX-2 réagit aux indices sonores dans le prompt. « Feu crépitant », « pas sur du gravier », « murmures de foule » donnent un meilleur foley que des descriptions vagues.
2. **Le déchargement sur CPU est essentiel** — avec 19 milliards de paramètres, le modèle a besoin de `enable_model_cpu_offload()` de cartes de 24 Go. Prévoyez 64 Go de RAM système.
3. **Stockage persistant** — le checkpoint du modèle fait environ 40 Go. Montez un volume persistant Clore.ai et définissez `HF_HOME` pour éviter de retélécharger à chaque redémarrage du conteneur.
4. **Multiplexer l’audio + la vidéo** — si le pipeline sort l’audio séparément, combinez avec : `ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac final.mp4`.
5. **bf16 uniquement** — le modèle à 19 milliards a été entraîné en bf16 ; fp16 entraînera une instabilité numérique.
6. **Traitement par lot dans tmux** — exécutez toujours à l’intérieur de `tmux` sur les locations Clore.ai pour survivre aux déconnexions SSH.
7. **Vérifiez l’ID du modèle** — comme LTX-2 vient d’être publié (janv. 2026), vérifiez l’ID exact du modèle Hugging Face sur la [page HF de Lightricks](https://huggingface.co/Lightricks) avant d’exécuter.

## Dépannage

| Problème                         | Correctif                                                                                                                                                     |
| -------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError`               | Activer `pipe.enable_model_cpu_offload()`; assurez-vous d’avoir ≥64 Go de RAM système                                                                         |
| Pas d’audio en sortie            | La génération audio peut nécessiter un indicateur explicite ou une version mise à jour de Diffusers ; consultez la fiche du modèle pour l’API la plus récente |
| Désynchronisation audio/vidéo    | Remultiplexez avec ffmpeg : `ffmpeg -i video.mp4 -i audio.wav -c:v copy -c:a aac -shortest out.mp4`                                                           |
| Génération très lente            | Le modèle 19B est gourmand en calcul ; comptez environ 2 à 4 min par clip de 5 s sur une RTX 4090                                                             |
| Sorties NaN                      | Utilisez `torch.bfloat16` — fp16 n’est pas pris en charge à cette échelle de modèle                                                                           |
| Erreur d’espace disque           | Le modèle fait environ 40 Go ; assurez-vous d’avoir au moins 80 Go d’espace disque libre avant le téléchargement                                              |
| `ModuleNotFoundError: soundfile` | `pip install soundfile` — nécessaire pour l’export audio WAV                                                                                                  |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/generation-video/ltx-video-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
