> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/generacion-3d/hunyuan-world-2.md).

# Hunyuan World 2.0 (modelo 3D del mundo)

Despliega HY-World 2.0 de Tencent: el primer modelo 3D del mundo de código abierto y SOTA en GPUs de Clore.ai para generación de escenas 3D a partir de texto, imagen o video

{% hint style="info" %}
**Publicado el 15 de abril de 2026** — Tencent Hunyuan lanzó **HY-World 2.0**, el primer modelo de mundo 3D SOTA totalmente de código abierto. Esta guía cubre **WorldMirror 2.0** (el componente de reconstrucción de \~1.2B parámetros incluido). Los modelos hermanos **HY-Pano 2.0** y **WorldStereo 2.0** están marcados como "próximamente" en el repositorio oficial — consulta la [Hoja de ruta](#roadmap) abajo.
{% endhint %}

HY-World 2.0 es el marco de trabajo multimodal de modelo de mundo de Tencent para **reconstruir, generar y simular escenas 3D completas**. A diferencia de los generadores de mallas de un solo objeto, HY-World ingiere texto, imágenes de una o varias vistas, o video, y emite representaciones de mundo editables — mallas, splats gaussianos 3D, nubes de puntos, mapas de profundidad, normales de superficie y parámetros de cámara recuperados — listas para integrar en Unity, Unreal o Blender.

Las primeras pesas públicas cubren **WorldMirror 2.0** (\~1.2B params, BF16) — la mitad de reconstrucción de la pila. Funciona con \~12–24 GB de VRAM en una sola GPU y admite resolución flexible de 50K a 500K píxeles, además de fragmentación FSDP multi-GPU para cargas de trabajo más grandes. Una API de Python (`diffusers`-style), CLI mediante `torchrun`, y una demo de Gradio se incluyen listos para usar. Un nodo de ComfyUI está **no** oficialmente disponible aún — solo portados por la comunidad.

{% hint style="success" %}
Todos los ejemplos de esta guía se ejecutan en servidores GPU alquilados a través de [Marketplace de CLORE.AI](https://clore.ai/marketplace).
{% endhint %}

### Especificaciones clave

| Propiedad           | Valor                                                                                       |
| ------------------- | ------------------------------------------------------------------------------------------- |
| Componente          | WorldMirror 2.0 (lanzado); HY-Pano 2.0 + WorldStereo 2.0 próximamente                       |
| Parámetros          | \~1.2B (BF16)                                                                               |
| Modos de entrada    | Texto · imagen de una sola vista · imágenes de múltiples vistas · video                     |
| Salida              | Malla · splat gaussiano 3D · nube de puntos · profundidad · normales · parámetros de cámara |
| VRAM                | \~12–24 GB una sola GPU; FSDP para varias GPU                                               |
| Rango de resolución | 50K – 500K píxeles (resolución flexible)                                                    |
| Licencia            | `tencent-hy-world-2.0-community` (personalizado — ver abajo)                                |
| Lanzamiento         | 2026-04-15                                                                                  |

{% hint style="warning" %}
**Advertencia sobre la licencia:** HY-World 2.0 se distribuye bajo una licencia comunitaria personalizada (`License.txt` en la raíz del repositorio), **no** Apache 2.0 o MIT. Los términos de uso comercial difieren de Hunyuan3D 2.1 de Tencent. Lee la licencia completa antes de distribuir cualquier cosa construida sobre ella.
{% endhint %}

### ¿Por qué HY-World 2.0?

* **Primer modelo de mundo SOTA de código abierto** — sin competidores cerrados en esta categoría
* **Salida de escena completa, no solo mallas** — splats gaussianos + geometría + cámara en una sola pasada
* **Entradas multimodales** — la misma canalización maneja texto, imágenes y video
* **Listo para FSDP** — escala entre 2 y 8 GPU para inferencia de alta resolución o por lotes
* **Listo para motores de juego** — las salidas se integran directamente en Unity, Unreal y Blender

***

## Requisitos

{% hint style="warning" %}
**Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai.** Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como [bare metal](https://clore.ai/bare-metal) bajo pedido. Consulta [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) antes de dimensionar un despliegue.
{% endhint %}

| Componente      | Mínimo                  | Recomendado                       |
| --------------- | ----------------------- | --------------------------------- |
| VRAM de GPU     | 16 GB (RTX 4080 / 3090) | 24–80 GB (RTX 4090 / A100 / H100) |
| RAM del sistema | 32 GB                   | 64–128 GB                         |
| Disco           | 80 GB                   | 200 GB                            |
| CUDA            | 12.8+                   | 12.8+                             |
| Python          | 3.10                    | 3.10                              |
| PyTorch         | 2.4.0                   | 2.4.0+                            |

{% hint style="info" %}
El modo multi-GPU requiere **≥ 1 imagen de entrada por GPU**. Para una sola imagen de referencia, usa una sola GPU y deja que FSDP entre en acción solo para trabajos por lotes o de alta resolución.
{% endhint %}

***

## Opción A — Inicio rápido con Docker + torchrun

Un mínimo `docker-compose.yml` para un contenedor de Clore.ai (la imagen oficial de Tencent aún no está publicada — esto usa la base de PyTorch y ejecuta la instalación del repositorio dentro):

```yaml
version: "3.8"
services:
  hyworld2:
    imagen: pytorch/pytorch:2.11.0-cuda12.8-cudnn9-devel
    ports:
      - "7860:7860"
    volumes:
      - ./workspace:/workspace
      - hf_cache:/root/.cache/huggingface
    working_dir: /workspace
    command: >
      bash -c "
        git clone https://github.com/Tencent-Hunyuan/HY-World-2.0 &&
        cd HY-World-2.0 &&
        pip install -r requirements.txt &&
        pip install flash-attn --no-build-isolation &&
        python -m hyworld2.worldrecon.gradio_app
      "
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

Ejecuta un trabajo de reconstrucción multi-GPU con FSDP y BF16:

```bash
torchrun --nproc_per_node=2 -m hyworld2.worldrecon.pipeline \\
    --input_path /workspace/input_images \\
    --use_fsdp --enable_bf16
```

***

## Opción B — API manual de Python

```bash
# Clonar e instalar
git clone https://github.com/Tencent-Hunyuan/HY-World-2.0
cd HY-World-2.0
conda create -n hyworld2 python=3.10 -y
conda activate hyworld2
pip install torch==2.4.0 torchvision==0.19.0 --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
pip install flash-attn --no-build-isolation
```

```python
from hyworld2.worldrecon.pipeline import WorldMirrorPipeline

# Carga ~1.2B pesos BF16 desde HF (tencent/HY-World-2.0)
pipeline = WorldMirrorPipeline.from_pretrained('tencent/HY-World-2.0')

# Reconstruye una escena 3D a partir de una carpeta de imágenes multivista
result = pipeline('path/to/images')

# Opcional: inyecta cámara previa + profundidad para una reconstrucción más ajustada
result = pipeline(
    'path/to/images',
    prior_cam_path='path/to/prior_camera.json',
    prior_depth_path='path/to/prior_depth/',
)
```

Inicia la demo de Gradio en el puerto 7860:

```bash
python -m hyworld2.worldrecon.gradio_app
```

Para Gradio multi-GPU con FSDP:

```bash
torchrun --nproc_per_node=2 -m hyworld2.worldrecon.gradio_app \\
    --use_fsdp --enable_bf16
```

***

## Recomendaciones de GPU para Clore.ai

| Carga de trabajo                                        | GPU        | VRAM       | Por qué                                                  | Coste de Clore.ai                         |
| ------------------------------------------------------- | ---------- | ---------- | -------------------------------------------------------- | ----------------------------------------- |
| Imagen única → escena, desarrollo/vista previa          | RTX 4090   | 24 GB      | BF16 cabe cómodamente, iteración rápida                  | $0.14–0.42/h                              |
| Reconstrucción de video multivista                      | A100 40 GB | 40 GB      | Maneja fotogramas de 200K+ px sin quedarse sin memoria   | [bare metal](https://clore.ai/bare-metal) |
| Procesamiento por lotes de alta resolución (producción) | A100 80 GB | 80 GB      | Resolución flexible completa de 500K px, lotes grandes   | [bare metal](https://clore.ai/bare-metal) |
| FSDP multi-GPU / investigación                          | 2–4× H100  | 160–320 GB | Cargas de trabajo fragmentadas a escala de entrenamiento | \~4,16 $/h                                |

{% hint style="success" %}
**Punto ideal en Clore.ai:** una sola **RTX 4090 a $0.14–0.42/h** maneja la inferencia cotidiana de WorldMirror. Pásate a una A100 solo cuando necesites reconstrucciones de más de 200K píxeles o entradas de video largas.
{% endhint %}

***

## Casos de uso

* **Desarrollo de juegos** — convierte arte conceptual en entornos 3D básicos para blockout y greybox
* **Contenido AR/VR** — genera escenas de splat gaussiano reproducibles en Unity/Unreal con fidelidad casi fotográfica
* **Previsualización para cine y animación** — reconstruye escenarios a partir de fotos en ubicación para cinematografía virtual
* **Visualización arquitectónica** — convierte fotos de referencia o briefs de texto en recorridos 3D editables
* **Robótica + simulación** — sintetiza entornos de entrenamiento 3D a partir de material real escaso

***

## Hoja de ruta

Tencent ha indicado lo siguiente como "próximamente" en el repositorio oficial:

* **HY-Pano 2.0** — generación de panoramas de 360° (interino: HunyuanWorld 1.0)
* **WorldStereo 2.0** — expansión del mundo / síntesis de nueva vista (interino: WorldStereo original)
* **WorldNav** — planificación de trayectoria para el recorrido de la escena
* **Código completo de la canalización de generación de mundos** — el punto de entrada de texto/imagen → mundo completo

WorldMirror 2.0 (reconstrucción) es hoy el único componente con pesos públicos. Mantente atento a la [página del modelo en HF](https://huggingface.co/tencent/HY-World-2.0) para nuevas publicaciones.

***

## Solución de problemas

| Problema                                          | Solución                                                                                                                                             |
| ------------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------- |
| `CUDA sin memoria` en GPU de 16 GB                | Reduce la resolución de entrada hacia 50K px, o cambia a una RTX 4090 (24 GB). Activa `--enable_bf16`                                                |
| FSDP se cuelga al iniciar                         | Asegúrate de que el número de imágenes de entrada sea **≥** `--nproc_per_node`. FSDP también necesita NCCL + una CUDA coincidente en todas las GPU   |
| `flash-attn` la instalación falla                 | Prueba el wheel precompilado `pip install flash-attn --no-build-isolation` en CUDA 12.8; si aún falla, la canalización se ejecuta (más lento) sin él |
| La interfaz de Gradio no es accesible en Clore.ai | Redirige el puerto 7860 en la configuración del contenedor de Clore, o inicia con `--share`                                                          |
| Preguntas sobre la licencia para uso comercial    | Lee `License.txt` en el repositorio — es `tencent-hy-world-2.0-community`, no OSS estándar                                                           |

***

## Siguientes pasos

* [Hunyuan3D 2.1](/guides/guides_v2-es/generacion-3d/hunyuan3d.md) — el generador de mallas de texto/imagen a un solo objeto de Tencent (más pequeño, canalización de estilo Apache, caso de uso diferente)
* [TRELLIS 3D](/guides/guides_v2-es/generacion-3d/trellis-3d.md) — el generador estructurado de activos 3D de Microsoft
* [Gaussian Splatting](/guides/guides_v2-es/generacion-3d/gaussian-splatting.md) — canalización de renderizado para las salidas de 3DGS que produce HY-World
* [Modelo de HuggingFace](https://huggingface.co/tencent/HY-World-2.0)
* [Repositorio de GitHub](https://github.com/Tencent-Hunyuan/HY-World-2.0)
* [Marketplace de CLORE.AI](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/generacion-3d/hunyuan-world-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
