> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/generation-3d/hunyuan-world-2.md).

# Hunyuan World 2.0 (modèle 3D du monde)

Déployez Tencent HY-World 2.0 — le premier modèle 3D du monde open source SOTA — sur les GPU Clore.ai pour la génération de scènes 3D à partir de texte, d'images ou de vidéos

{% hint style="info" %}
**Sorti le 15 avril 2026** — Tencent Hunyuan a été publié **HY-World 2.0**, le premier modèle de monde 3D SOTA entièrement open source. Ce guide couvre **WorldMirror 2.0** (le composant de reconstruction livré d'environ 1,2 milliard de paramètres). Les modèles frères **HY-Pano 2.0** et **WorldStereo 2.0** sont signalés « à venir » dans le dépôt officiel — voir le [Feuille de route](#roadmap) ci-dessous.
{% endhint %}

HY-World 2.0 est le framework de modèle de monde multimodal de Tencent pour **reconstruire, générer et simuler des scènes 3D complètes**. Contrairement aux générateurs de maillages pour objets uniques, HY-World ingère du texte, des images à vue unique ou multi-vues, ou de la vidéo et produit des représentations de monde modifiables — maillages, splats gaussiens 3D, nuages de points, cartes de profondeur, normales de surface et paramètres de caméra récupérés — prêtes à être intégrées dans Unity, Unreal ou Blender.

Les premiers poids publics couvrent **WorldMirror 2.0** (\~1,2 milliard de paramètres, BF16) — la partie reconstruction de la pile. Il fonctionne avec \~12–24 Go de VRAM sur un seul GPU et prend en charge une résolution flexible de 50K à 500K pixels, ainsi que le sharding FSDP multi-GPU pour des charges de travail plus importantes. Une API Python (`diffusers`de type), interface CLI via `torchrun`, et une démo Gradio sont fournis prêts à l'emploi. Un nœud ComfyUI est **pas** pas encore officiel — uniquement des ports communautaires.

{% hint style="success" %}
Tous les exemples de ce guide s'exécutent sur des serveurs GPU loués via le [la place de marché CLORE.AI](https://clore.ai/marketplace).
{% endhint %}

### Spécifications clés

| Propriété           | Valeur                                                                                        |
| ------------------- | --------------------------------------------------------------------------------------------- |
| Composant           | WorldMirror 2.0 (livré) ; HY-Pano 2.0 + WorldStereo 2.0 à venir                               |
| Paramètres          | \~1,2 milliard (BF16)                                                                         |
| Modalités d'entrée  | Texte · image à vue unique · images multi-vues · vidéo                                        |
| Sortie              | Maillage · splat gaussien 3D · nuage de points · profondeur · normales · paramètres de caméra |
| VRAM                | \~12–24 Go sur un seul GPU ; FSDP pour multi-GPU                                              |
| Plage de résolution | 50K – 500K pixels (résolution flexible)                                                       |
| Licence             | `tencent-hy-world-2.0-community` (personnalisé — voir ci-dessous)                             |
| Version             | 2026-04-15                                                                                    |

{% hint style="warning" %}
**Avertissement de licence :** HY-World 2.0 est distribué sous une licence communautaire personnalisée (`License.txt` à la racine du dépôt), **pas** Apache 2.0 ou MIT. Les conditions d'utilisation commerciale diffèrent de celles de Hunyuan3D 2.1 de Tencent. Lisez la licence complète avant de commercialiser quoi que ce soit fondé dessus.
{% endhint %}

### Pourquoi HY-World 2.0 ?

* **Premier modèle de monde SOTA open source** — aucun concurrent propriétaire dans cette catégorie
* **Sortie de scène complète, pas seulement des maillages** — splats gaussiens + géométrie + caméra en une seule passe
* **Entrées multimodales** — le même pipeline gère le texte, les images et la vidéo
* **Prêt pour FSDP** — mise à l'échelle sur 2 à 8 GPU pour l'inférence haute résolution ou par lots
* **Prêt pour les moteurs de jeu** — les sorties s'intègrent directement dans Unity, Unreal et Blender

***

## Exigences

{% hint style="warning" %}
**Les configurations multi-GPU de classe 80 Go ne sont pas répertoriées sur la place de marché Clore.ai.** Les plus grosses machines répertoriées aujourd’hui sont 4× RTX PRO 6000 Blackwell (96 Go chacune, 380 Go au total) et 8–11× RTX 5090 (32 Go chacune). La capacité A100 / H200 / B200 est proposée en bare metal sur demande. Consultez [bare metal](https://clore.ai/bare-metal) sur demande. Consultez [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md) avant de dimensionner un déploiement.
{% endhint %}

| Composant   | Minimum                 | Recommandé                        |
| ----------- | ----------------------- | --------------------------------- |
| VRAM GPU    | 16 Go (RTX 4080 / 3090) | 24–80 Go (RTX 4090 / A100 / H100) |
| RAM système | 32 Go                   | 64–128 Go                         |
| Disque      | 80 Go                   | 200 Go                            |
| CUDA        | 12.8+                   | 12.8+                             |
| Python      | 3.10                    | 3.10                              |
| PyTorch     | 2.4.0                   | 2.4.0+                            |

{% hint style="info" %}
Le mode multi-GPU nécessite **≥ 1 image d'entrée par GPU**. Pour une seule image de référence, restez sur un seul GPU et laissez FSDP intervenir uniquement pour les traitements par lots ou haute résolution.
{% endhint %}

***

## Option A — Démarrage rapide avec Docker + torchrun

Un minimum `docker-compose.yml` pour un conteneur Clore.ai (l'image officielle Tencent n'est pas encore publiée — cela utilise la base PyTorch et lance l'installation du dépôt à l'intérieur) :

```yaml
version: "3.8"
services:
  hyworld2:
    image : pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel
    ports:
      - "7860:7860"
    volumes:
      - ./workspace:/workspace
      - hf_cache:/root/.cache/huggingface
    working_dir: /workspace
    command: >
      bash -c "
        git clone https://github.com/Tencent-Hunyuan/HY-World-2.0 &&
        cd HY-World-2.0 &&
        pip install -r requirements.txt &&
        pip install flash-attn --no-build-isolation &&
        python -m hyworld2.worldrecon.gradio_app
      "
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

Lancez un travail de reconstruction multi-GPU avec FSDP et BF16 :

```bash
torchrun --nproc_per_node=2 -m hyworld2.worldrecon.pipeline \
    --input_path /workspace/input_images \
    --use_fsdp --enable_bf16
```

***

## Option B — API Python manuelle

```bash
# Cloner et installer
git clone https://github.com/Tencent-Hunyuan/HY-World-2.0
cd HY-World-2.0
conda create -n hyworld2 python=3.10 -y
conda activate hyworld2
pip install torch==2.4.0 torchvision==0.19.0 --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
pip install flash-attn --no-build-isolation
```

```python
from hyworld2.worldrecon.pipeline import WorldMirrorPipeline

# Charge ~1,2 milliard de poids BF16 depuis HF (tencent/HY-World-2.0)
pipeline = WorldMirrorPipeline.from_pretrained('tencent/HY-World-2.0')

# Reconstruire une scène 3D à partir d'un dossier d'images multi-vues
result = pipeline('path/to/images')

# Optionnel : injecter une caméra préalable + profondeur pour une reconstruction plus précise
result = pipeline(
    'path/to/images',
    prior_cam_path='path/to/prior_camera.json',
    prior_depth_path='path/to/prior_depth/',
)
```

Lancez la démo Gradio sur le port 7860 :

```bash
python -m hyworld2.worldrecon.gradio_app
```

Pour Gradio multi-GPU avec FSDP :

```bash
torchrun --nproc_per_node=2 -m hyworld2.worldrecon.gradio_app \
    --use_fsdp --enable_bf16
```

***

## Recommandations GPU Clore.ai

| Charge de travail                                 | GPU        | VRAM       | Pourquoi                                                              | Coût Clore.ai                             |
| ------------------------------------------------- | ---------- | ---------- | --------------------------------------------------------------------- | ----------------------------------------- |
| Image unique → scène, développement/aperçu        | RTX 4090   | 24 Go      | BF16 tient confortablement, itération rapide                          | 0,14–0,42 $/h                             |
| Reconstruction vidéo multi-vues                   | A100 40 Go | 40 Go      | Gère des images de plus de 200K px sans OOM                           | [bare metal](https://clore.ai/bare-metal) |
| Traitement par lots haute résolution (production) | A100 80 Go | 80 Go      | Résolution flexible complète de 500K px, gros lots                    | [bare metal](https://clore.ai/bare-metal) |
| FSDP multi-GPU / recherche                        | 2–4× H100  | 160–320 Go | Charges de travail à l'échelle de l'entraînement, réparties en shards | \~4,16 $/h                                |

{% hint style="success" %}
**Point idéal sur Clore.ai :** un seul **RTX 4090 à 0,14–0,42 $/h** suffit pour l'inférence WorldMirror quotidienne. Passez à une A100 uniquement lorsque vous avez besoin de reconstructions >200K pixels ou d'entrées vidéo longues.
{% endhint %}

***

## Cas d’usage

* **Développement de jeux** — transformez des concept arts en environnements 3D sommaires pour le blockout et le greyboxing
* **Contenu AR/VR** — générez des scènes en splats gaussiens jouables dans Unity/Unreal avec une fidélité proche de la photographie
* **Prévisualisation cinéma et animation** — reconstruisez des décors à partir de photos prises sur le lieu de tournage pour la cinématographie virtuelle
* **Visualisation architecturale** — convertissez des photos de référence ou des briefs textuels en visites 3D modifiables
* **Robotique + simulation** — synthétisez des environnements d'entraînement 3D à partir d'images réelles clairsemées

***

## Feuille de route

Tencent a indiqué les éléments suivants comme « à venir » dans le dépôt officiel :

* **HY-Pano 2.0** — génération de panoramas à 360° (en attendant : HunyuanWorld 1.0)
* **WorldStereo 2.0** — extension de monde / synthèse de nouvelles vues (en attendant : WorldStereo original)
* **WorldNav** — planification de trajectoire pour la traversée de scène
* **Code complet du pipeline de génération de monde** — le point d'entrée texte/image → monde complet

WorldMirror 2.0 (reconstruction) est aujourd'hui le seul composant avec des poids publics. Gardez un œil sur la [page du modèle HF](https://huggingface.co/tencent/HY-World-2.0) pour les nouvelles versions.

***

## Dépannage

| Problème                                             | Solution                                                                                                                                                          |
| ---------------------------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `Mémoire CUDA insuffisante` sur un GPU de 16 Go      | Réduisez la résolution d'entrée vers 50K px, ou passez à une RTX 4090 (24 Go). Activez `--enable_bf16`                                                            |
| FSDP se bloque au lancement                          | Assurez-vous que le nombre d'images d'entrée est **≥** `--nproc_per_node`. FSDP nécessite aussi NCCL + une version CUDA identique sur tous les GPU                |
| `flash-attn` l'installation échoue                   | Essayez la roue précompilée `pip install flash-attn --no-build-isolation` sur CUDA 12.8 ; si cela échoue encore, le pipeline fonctionne (plus lentement) sans lui |
| L'interface Gradio n'est pas accessible sur Clore.ai | Redirigez le port 7860 dans la configuration du conteneur Clore, ou lancez avec `--share`                                                                         |
| Questions de licence pour un usage commercial        | Lisez `License.txt` dans le dépôt — il s'agit de `tencent-hy-world-2.0-community`, et non d'OSS standard                                                          |

***

## Étapes suivantes

* [Hunyuan3D 2.1](/guides/guides_v2-fr/generation-3d/hunyuan3d.md) — le générateur texte/image-vers-maillage à objet unique de Tencent (pipeline plus petit, de style Apache, cas d'usage différent)
* [TRELLIS 3D](/guides/guides_v2-fr/generation-3d/trellis-3d.md) — le générateur d'assets 3D structurés de Microsoft
* [Gaussian Splatting](/guides/guides_v2-fr/generation-3d/gaussian-splatting.md) — pipeline de rendu pour les sorties 3DGS produites par HY-World
* [modèle HuggingFace](https://huggingface.co/tencent/HY-World-2.0)
* [dépôt GitHub](https://github.com/Tencent-Hunyuan/HY-World-2.0)
* [la place de marché CLORE.AI](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/generation-3d/hunyuan-world-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
