> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/3d-generierung/hunyuan-world-2.md).

# Hunyuan World 2.0 (3D-Weltmodell)

Deploye Tencent HY-World 2.0 — das erste Open-Source-SOTA-3D-Weltmodell — auf Clore.ai-GPUs für die Generierung von 3D-Szenen aus Text/Bild/Video

{% hint style="info" %}
**Veröffentlicht am 15. April 2026** — Tencent Hunyuan veröffentlicht **HY-World 2.0**, das erste vollständig Open-Source-SOTA-3D-Weltmodell. Dieser Leitfaden behandelt **WorldMirror 2.0** (die ausgelieferte Rekonstruktionskomponente mit \~1,2 Mrd. Parametern). Schwester-Modelle **HY-Pano 2.0** und **WorldStereo 2.0** sind im offiziellen Repo als „demnächst verfügbar“ markiert — siehe die [Roadmap](#roadmap) unten.
{% endhint %}

HY-World 2.0 ist Tencents multimodales Weltmodell-Framework zum **Rekonstruieren, Generieren und Simulieren vollständiger 3D-Szenen**. Anders als Generatoren für einzelne Objekte nimmt HY-World Text, Einzel- oder Mehransichts-Bilder oder Video auf und gibt bearbeitbare Weltdarstellungen aus — Meshes, 3D-Gaussian-Splats, Punktwolken, Tiefenkarten, Oberflächennormalen und rekonstruierte Kameraparameter — bereit für den direkten Einsatz in Unity, Unreal oder Blender.

Die ersten öffentlichen Gewichte umfassen **WorldMirror 2.0** (\~1,2 Mrd. Parameter, BF16) — die Rekonstruktionshälfte des Stacks. Sie läuft auf einer einzelnen GPU mit \~12–24 GB VRAM und unterstützt flexible Auflösungen von 50K bis 500K Pixeln sowie FSDP-Multi-GPU-Sharding für größere Workloads. Eine Python-API (`diffusers`-Stil), CLI über `torchrun`, und eine Gradio-Demo sind direkt mit dabei. Ein ComfyUI-Node ist **nicht** noch nicht offiziell vorhanden — nur Community-Ports.

{% hint style="success" %}
Alle Beispiele in diesem Leitfaden laufen auf GPU-Servern, die über das [CLORE.AI-Marktplatz](https://clore.ai/marketplace).
{% endhint %}

### Wichtige Spezifikationen

| Eigenschaft        | Wert                                                                              |
| ------------------ | --------------------------------------------------------------------------------- |
| Komponente         | WorldMirror 2.0 (ausgeliefert); HY-Pano 2.0 + WorldStereo 2.0 demnächst verfügbar |
| Parameter          | \~1,2 Mrd. (BF16)                                                                 |
| Eingabemodalitäten | Text · Einzelansichtsbild · Mehransichtsbilder · Video                            |
| Ausgabe            | Mesh · 3D-Gaussian-Splat · Punktwolke · Tiefe · Normalen · Kameraparameter        |
| VRAM               | \~12–24 GB auf einer einzelnen GPU; FSDP für Multi-GPU                            |
| Auflösungsbereich  | 50K – 500K Pixel (flexible Auflösung)                                             |
| Lizenz             | `tencent-hy-world-2.0-community` (benutzerdefiniert — siehe unten)                |
| Veröffentlichung   | 2026-04-15                                                                        |

{% hint style="warning" %}
**Lizenzhinweis:** HY-World 2.0 wird unter einer benutzerdefinierten Community-Lizenz ausgeliefert (`License.txt` im Repository-Stammverzeichnis), **nicht** Apache 2.0 oder MIT. Die Bedingungen für die kommerzielle Nutzung unterscheiden sich von Tencents Hunyuan3D 2.1. Lies die vollständige Lizenz, bevor du etwas darauf basierend veröffentlichst.
{% endhint %}

### Warum HY-World 2.0?

* **Erstes Open-Source-SOTA-Weltmodell** — keine geschlossenen Konkurrenten in dieser Kategorie
* **Vollständige Szenenausgabe, nicht nur Meshes** — Gaussian Splats + Geometrie + Kamera in einem Durchlauf
* **Multimodale Eingaben** — dieselbe Pipeline verarbeitet Text, Bilder und Video
* **FSDP-bereit** — Skalierung über 2–8 GPUs für hochauflösende oder Batch-Inferenz
* **Bereit für Game-Engines** — Ausgaben lassen sich direkt in Unity, Unreal und Blender übernehmen

***

## Anforderungen

{% hint style="warning" %}
**Multi-GPU-Rigs der 80GB-Klasse sind auf dem Clore.ai-Marktplatz nicht gelistet.** Die größten heute gelisteten Systeme sind 4× RTX PRO 6000 Blackwell (je 96 GB, 380 GB gesamt) und 8–11× RTX 5090 (je 32 GB). Kapazitäten für A100 / H200 / B200 werden als [Bare Metal](https://clore.ai/bare-metal) auf Anfrage verkauft. Prüfe [GPU-Preise & Verfügbarkeit](/guides/guides_v2-de/erste-schritte/pricing.md) bevor du eine Bereitstellung dimensionierst.
{% endhint %}

| Komponente | Minimum                 | Empfohlen                         |
| ---------- | ----------------------- | --------------------------------- |
| GPU-VRAM   | 16 GB (RTX 4080 / 3090) | 24–80 GB (RTX 4090 / A100 / H100) |
| System-RAM | 32 GB                   | 64–128 GB                         |
| Festplatte | 80 GB                   | 200 GB                            |
| CUDA       | 12.8+                   | 12.8+                             |
| Python     | 3.10                    | 3.10                              |
| PyTorch    | 2.4.0                   | 2.4.0+                            |

{% hint style="info" %}
Der Multi-GPU-Modus erfordert **≥ 1 Eingabebild pro GPU**. Bei einem einzelnen Referenzbild bleibe bei einer GPU und lass FSDP nur bei Batch- oder hochauflösenden Jobs greifen.
{% endhint %}

***

## Option A — Schnellstart mit Docker + torchrun

Eine minimale `docker-compose.yml` für einen Clore.ai-Container (das offizielle Tencent-Image ist noch nicht veröffentlicht — hier wird die PyTorch-Basis verwendet und die Repository-Installation darin ausgeführt):

```yaml
version: "3.8"
services:
  hyworld2:
    image: pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel
    ports:
      - "7860:7860"
    volumes:
      - ./workspace:/workspace
      - hf_cache:/root/.cache/huggingface
    working_dir: /workspace
    command: >
      bash -c "
        git clone https://github.com/Tencent-Hunyuan/HY-World-2.0 &&
        cd HY-World-2.0 &&
        pip install -r requirements.txt &&
        pip install flash-attn --no-build-isolation &&
        python -m hyworld2.worldrecon.gradio_app
      "
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

Führe einen Multi-GPU-Rekonstruktionsjob mit FSDP und BF16 aus:

```bash
torchrun --nproc_per_node=2 -m hyworld2.worldrecon.pipeline \\
    --input_path /workspace/input_images \\
    --use_fsdp --enable_bf16
```

***

## Option B — Manuelle Python-API

```bash
# Klonen und installieren
git clone https://github.com/Tencent-Hunyuan/HY-World-2.0
cd HY-World-2.0
conda create -n hyworld2 python=3.10 -y
conda activate hyworld2
pip install torch==2.4.0 torchvision==0.19.0 --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
pip install flash-attn --no-build-isolation
```

```python
from hyworld2.worldrecon.pipeline import WorldMirrorPipeline

# Lädt ~1,2 Mrd. BF16-Gewichte von HF (tencent/HY-World-2.0)
pipeline = WorldMirrorPipeline.from_pretrained('tencent/HY-World-2.0')

# Rekonstruiere eine 3D-Szene aus einem Ordner mit Mehransichts-Bildern
result = pipeline('path/to/images')

# Optional: frühere Kamera + Tiefe für eine präzisere Rekonstruktion einfügen
result = pipeline(
    'path/to/images',
    prior_cam_path='path/to/prior_camera.json',
    prior_depth_path='path/to/prior_depth/',
)
```

Starte die Gradio-Demo auf Port 7860:

```bash
python -m hyworld2.worldrecon.gradio_app
```

Für Gradio mit Multi-GPU und FSDP:

```bash
torchrun --nproc_per_node=2 -m hyworld2.worldrecon.gradio_app \\
    --use_fsdp --enable_bf16
```

***

## GPU-Empfehlungen für Clore.ai

| Workload                                 | GPU        | VRAM       | Warum                                          | Clore.ai-Kosten                           |
| ---------------------------------------- | ---------- | ---------- | ---------------------------------------------- | ----------------------------------------- |
| Einzelbild → Szene, Entwicklung/Vorschau | RTX 4090   | 24 GB      | BF16 passt problemlos, schnelle Iteration      | ca. 0,14–0,42 $/h                         |
| Rekonstruktion von Mehransichts-Videos   | A100 40 GB | 40 GB      | Verarbeitet Frames mit 200K+ Pixeln ohne OOM   | [Bare Metal](https://clore.ai/bare-metal) |
| Hochauflösend im Batch (Produktion)      | A100 80 GB | 80 GB      | Volle 500K-Pixel-Flex-Auflösung, große Batches | [Bare Metal](https://clore.ai/bare-metal) |
| FSDP-Multi-GPU / Forschung               | 2–4× H100  | 160–320 GB | Geshardete Workloads im Trainingsmaßstab       | \~$4,16/h                                 |

{% hint style="success" %}
**Optimale Wahl auf Clore.ai:** eine einzelne **RTX 4090 für 0,14–0,42 $/h** bewältigt die alltägliche WorldMirror-Inferenz. Steige nur auf eine A100 um, wenn du Rekonstruktionen mit mehr als 200K Pixeln oder lange Videoeingaben brauchst.
{% endhint %}

***

## Anwendungsfälle

* **Spieleentwicklung** — verwandle Concept Art in grobe 3D-Umgebungen für Blockout und Greybox
* **AR/VR-Inhalte** — generiere Gaussian-Splat-Szenen, die in Unity/Unreal mit nahezu fotografischer Treue abspielbar sind
* **Previs für Film und Animation** — rekonstruiere Sets aus Fotos vom Drehort für virtuelle Kinematografie
* **Architekturvisualisierung** — verwandle Referenzaufnahmen oder Textbriefings in bearbeitbare 3D-Rundgänge
* **Robotik + Simulation** — synthetisiere 3D-Trainingsumgebungen aus spärlichem Realwelt-Material

***

## Roadmap

Tencent hat die folgenden Punkte im offiziellen Repo als „demnächst verfügbar“ aufgeführt:

* **HY-Pano 2.0** — 360°-Panorama-Generierung (vorübergehend: HunyuanWorld 1.0)
* **WorldStereo 2.0** — Welterweiterung / Novel-View-Synthese (vorübergehend: ursprüngliches WorldStereo)
* **WorldNav** — Trajektorienplanung für das Durchqueren von Szenen
* **Vollständiger Pipeline-Code zur Welterzeugung** — der Einstiegspunkt von Text/Bild → vollständige Welt

WorldMirror 2.0 (Rekonstruktion) ist heute die einzige Komponente mit öffentlichen Gewichten. Behalte die [HF-Modellseite](https://huggingface.co/tencent/HY-World-2.0) für Neuveröffentlichungen im Blick.

***

## Fehlerbehebung

| Problem                                       | Lösung                                                                                                                                                                       |
| --------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `CUDA-Speicher erschöpft` auf einer 16-GB-GPU | Verringere die Eingangsauflösung auf 50K Pixel oder wechsle zu einer RTX 4090 (24 GB). Aktiviere `--enable_bf16`                                                             |
| FSDP hängt beim Start                         | Stelle sicher, dass die Anzahl der Eingabebilder **≥** `--nproc_per_node`. FSDP benötigt außerdem NCCL + passende CUDA-Versionen über alle GPUs hinweg                       |
| `flash-attn` Installation schlägt fehl        | Versuche ein vorgefertigtes Wheel `pip install flash-attn --no-build-isolation` unter CUDA 12.8; wenn es immer noch fehlschlägt, läuft die Pipeline (langsamer) auch ohne es |
| Gradio-UI auf Clore.ai nicht erreichbar       | Leite Port 7860 in der Clore-Containerkonfiguration weiter, oder starte mit `--share`                                                                                        |
| Fragen zur Lizenz für kommerzielle Nutzung    | Lies `License.txt` im Repo — sie ist `tencent-hy-world-2.0-community`, nicht standardmäßige OSS                                                                              |

***

## Nächste Schritte

* [Hunyuan3D 2.1](/guides/guides_v2-de/3d-generierung/hunyuan3d.md) — Tencents Text/Bild-zu-Mesh-Generator für einzelne Objekte (kleinere Pipeline im Apache-Stil, anderer Anwendungsfall)
* [TRELLIS 3D](/guides/guides_v2-de/3d-generierung/trellis-3d.md) — Microsofts strukturierter 3D-Asset-Generator
* [Gaussian Splatting](/guides/guides_v2-de/3d-generierung/gaussian-splatting.md) — Render-Pipeline für die von HY-World erzeugten 3DGS-Ausgaben
* [HuggingFace-Modell](https://huggingface.co/tencent/HY-World-2.0)
* [GitHub-Repo](https://github.com/Tencent-Hunyuan/HY-World-2.0)
* [CLORE.AI-Marktplatz](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/3d-generierung/hunyuan-world-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
