> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/hy3-preview.md).

# Hy3 Preview (Tencent Hunyuan 3, 295B MoE)

Despliega Hy3 Preview de Tencent (295B MoE, 21B activos, contexto de 256K) en Clore.ai: el primer modelo del stack de entrenamiento reconstruido de Tencent Hunyuan, afinado para razonamiento de largo alcance y codificación agéntica

{% hint style="info" %}
**Estado (abril de 2026):** Hy3 Preview es la primera versión pública de **la infraestructura de entrenamiento reconstruida de Tencent Hunyuan**, publicada el **13 de abril de 2026** y actualizada por última vez **23 de abril de 2026**. Los pesos están en [huggingface.co/tencent/Hy3-preview](https://huggingface.co/tencent/Hy3-preview) bajo la **Licencia Comunitaria Tencent Hy**. El soporte desde el día 0 llegó a vLLM y SGLang.
{% endhint %}

Hy3 Preview es un **Mixture-of-Experts de 295B parámetros** modelo de lenguaje que activa solo **\~21B parámetros por token** (192 expertos, enrutado top-8). Apunta a dos cargas de trabajo en las que Tencent ha estado recortando distancias de forma visible: **razonamiento de largo horizonte** (FrontierScience-Olympiad, IMOAnswerBench, exámenes de doctorado en matemáticas) y **programación agéntica** (SWE-bench Verified 74.4%, Terminal-Bench 2.0 54.4%, según el proveedor). La ventana de contexto de 256K junto con una capa de decodificación especulativa MTP (Predicción de Múltiples Tokens) lo hacen práctico para agentes de programación a escala de IDE y RAG con muchos documentos.

Para los usuarios de Clore.ai, la cifra principal es **21B activos**. No necesitas un rack completo de 8×H200. Un despliegue en paralelo tensorial en **4×A100 80GB** o **2×H100 80GB** (BF16 con offload) es suficiente para servirlo con un rendimiento utilizable — programación agéntica de clase frontier por \~$2.08/h en el marketplace, con los pesos permaneciendo en tu propia máquina.

### Especificaciones clave

| Propiedad                | Valor                                                     |
| ------------------------ | --------------------------------------------------------- |
| Parámetros totales       | 295B (MoE)                                                |
| Parámetros activos       | 21B por pasada hacia adelante                             |
| Expertos                 | 192 en total, top-8 enrutados                             |
| Capas                    | 80 de transformer + 1 MTP                                 |
| Atención                 | 64 cabezas, GQA con 8 cabezas KV, dimensión de cabeza 128 |
| Tamaño oculto            | 4096                                                      |
| Tamaño intermedio        | 13,312                                                    |
| Vocabulario              | 120,832                                                   |
| Ventana de contexto      | 256.000 tokens                                            |
| Precisión nativa         | BF16                                                      |
| Licencia                 | Licencia Comunitaria Tencent Hy                           |
| Fecha de lanzamiento     | 13 de abril de 2026                                       |
| Organización             | Tencent Hunyuan                                           |
| Herramientas principales | vLLM, SGLang, AngelSlim, LLaMA-Factory                    |

### ¿Por qué Hy3 Preview?

* **Primero en la pila de RL reconstruida de Tencent** — Tencent reescribió su infraestructura de entrenamiento para este lanzamiento; espera una iteración rápida durante 2026
* **MoE de 21B activos** — pagas el costo de inferencia de un modelo denso de \~21B, no de 295B
* **contexto de 256K** — suficiente para repos completos, trazas largas de agentes o RAG de múltiples documentos en una sola pasada
* **capa especulativa MTP** — la predicción multitoken integrada proporciona aceleraciones de decodificación de \~1.5–2× en GPU de clase Hopper
* **Dos modos de razonamiento** — `reasoning_effort: "high"` para cadena de pensamiento, `"no_think"` para respuestas directas rápidas
* **Enfoque en programación agéntica** — ajustado explícitamente para uso de herramientas en múltiples turnos al estilo SWE-bench y agentes de terminal
* **Licencia amigable con el código abierto** — Tencent Hy Community License es de estilo Apache para la mayoría de los usos; verifica el archivo LICENSE para tu caso

***

## Requisitos

{% hint style="warning" %}
**Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai.** Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como [bare metal](https://clore.ai/bare-metal) bajo pedido. Consulta [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) antes de dimensionar un despliegue.
{% endhint %}

{% hint style="warning" %}
**Sigue siendo un modelo de clase 295B.** "21B active" describe el cómputo de inferencia, no la huella de memoria. Los pesos BF16 completos son \~590GB y deben residir en VRAM (o descargarse). Planifica 8×H100/H200 si quieres un rendimiento sin restricciones; 4×A100 80GB funciona con offload y contextos más cortos.
{% endhint %}

| Componente  | Mínimo (Q4 GGUF, offload)        | Recomendado (BF16, TP) | BF16 completo (producción) |
| ----------- | -------------------------------- | ---------------------- | -------------------------- |
| VRAM de GPU | \~80GB + offload de 256GB de RAM | 4× A100 80GB (320GB)   | 8× H100 80GB o 8× H20-3e   |
| RAM         | 256GB                            | 384GB                  | 512GB                      |
| Disco       | 700GB NVMe                       | 1TB NVMe               | 1.5TB NVMe                 |
| CUDA        | 12.8+                            | 12.8+                  | 12.8+                      |
| Controlador | 550+                             | 550+                   | 560+                       |

**Adecuación de hardware:** Para la mayoría de los equipos, **4× A100 80GB** con paralelo tensorial BF16 y `--max-model-len 65536` es el punto óptimo ([bare metal](https://clore.ai/bare-metal)). Si necesitas el contexto completo de 256K con usuarios concurrentes, salta a 8× H100.

***

## Opción A — Ollama / GGUF (Cuantizado, compilaciones de la comunidad)

{% hint style="warning" %}
**Aviso:** Hy3 Preview es muy nuevo (13 de abril de 2026) y usa una arquitectura MoE personalizada. El soporte comunitario de llama.cpp / GGUF suele llegar **2–4 semanas** después del lanzamiento. Si lo necesitas hoy, usa vLLM (Opción B). Consulta [huggingface.co/models?search=hy3-preview+gguf](https://huggingface.co/models?search=hy3-preview+gguf) las cuantizaciones de la comunidad antes de descargar.
{% endhint %}

```bash
# Una vez que se publique una compilación Q4_K_M
docker exec ollama ollama pull hy3-preview:q4_K_M
docker exec ollama ollama run hy3-preview:q4_K_M

# O con llama.cpp directamente sobre un GGUF de la comunidad
docker run --gpus all -it --rm -p 8080:8080 \
  -v $(pwd)/models:/models \
  ghcr.io/ggerganov/llama.cpp:server-cuda \
  -m /models/hy3-preview-q4_k_m.gguf \\
  --n-gpu-layers 80 --ctx-size 32768 \\
  --port 8080 --host 0.0.0.0
```

Antes de que existieran los GGUF, AngelSlim (la propia herramienta de cuantización de Tencent) puede producir pesos W4A16 / W8A8 directamente desde el checkpoint BF16.

***

## Opción B — vLLM (API de producción, recomendado)

vLLM es el objetivo de servicio de primera clase de Tencent para Hy3 Preview. La capa especulativa MTP se integra mediante `--speculative-config.method mtp`.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model tencent/Hy3-preview
      --tensor-parallel-size 8
      --max-model-len 65536
      --gpu-memory-utilization 0.90
      --speculative-config.method mtp
      --speculative-config.num_speculative_tokens 1
      --tool-call-parser hy_v3
      --reasoning-parser hy_v3
      --enable-auto-tool-choice
      --served-model-name hy3-preview
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Prueba la API con alto esfuerzo de razonamiento
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "hy3-preview",
    "messages": [
      {"role": "system", "content": "Eres un ingeniero de software experto."},
      {"role": "user", "content": "Refactoriza esta función de Python para usar async/await y añade un manejo adecuado de errores."}
    ],
    "max_tokens": 4096,
    "temperature": 0.9,
    "top_p": 1.0,
    "reasoning_effort": "high"
  }'
```

{% hint style="info" %}
**Modos de razonamiento.** Establece `reasoning_effort: "high"` para habilitar trazas de cadena de pensamiento (más lento, mucho mejor en tareas de matemáticas/codificación/agentes) o `"no_think"` para respuestas directas rápidas. El muestreo recomendado por el proveedor es `temperature=0.9, top_p=1.0` — el muestreo a temperatura cero puede romper las trazas de razonamiento.
{% endhint %}

{% hint style="info" %}
**¿Escasez de GPU?** Baja a `--tensor-parallel-size 4` en 4× A100 80GB. Mantén `--max-model-len 32768` y añade `--enable-chunked-prefill` para mantener una latencia de prefill razonable.
{% endhint %}

***

## Opción C — SGLang

SGLang incluye soporte desde el día 0 y combina la capa MTP con la decodificación especulativa EAGLE para obtener mayor rendimiento en Hopper.

```bash
docker pull lmsysorg/sglang:latest

python3 -m sglang.launch_server \\
  --model tencent/Hy3-preview \\
  --tp 8 \\
  --tool-call-parser hunyuan \\
  --reasoning-parser hunyuan \\
  --speculative-algorithm EAGLE \\
  --speculative-num-steps 1 \\
  --speculative-eagle-topk 1 \\
  --speculative-num-draft-tokens 2 \\
  --mem-fraction-static 0.88 \
  --context-length 65536 \\
  --served-model-name hy3-preview
```

Espera un aumento de rendimiento de 1.5–2× en bucles largos de agente frente a la decodificación estándar.

***

## Recomendaciones de GPU para Clore.ai

| Configuración | VRAM    | Rendimiento esperado                             | Coste de Clore.ai                         | Alquilar                                         |
| ------------- | ------- | ------------------------------------------------ | ----------------------------------------- | ------------------------------------------------ |
| 4× A100 80GB  | 320 GB  | BF16 fragmentado, ctx 64K, \~15–25 tok/s         | [bare metal](https://clore.ai/bare-metal) | [Hardware dedicado](https://clore.ai/bare-metal) |
| 2× H100 80GB  | 160 GB  | BF16 con offload, ctx más pequeño, \~12–20 tok/s | \~$2.08/hr                                | [Alquilar H100](https://clore.ai/rent-h100.html) |
| 8× H100 80GB  | 640 GB  | BF16 completo, ctx 256K, 60+ tok/s con MTP       | \~$8.32/hr                                | [Alquilar H100](https://clore.ai/rent-h100.html) |
| 8× H200 141GB | 1,128GB | BF16 completo + máxima concurrencia              | [bare metal](https://clore.ai/bare-metal) | [Hardware dedicado](https://clore.ai/bare-metal) |
| 1× RTX 5090   | 32GB    | Q4 GGUF, offload a RAM, usuario único            | $0.25–0.77/h                              | [Marketplace](https://clore.ai/marketplace)      |

{% hint style="success" %}
**La mejor opción:** 4× A100 80GB con paralelo tensorial BF16 y una ventana de contexto de 64K, disponible como [bare metal](https://clore.ai/bare-metal) en lugar de un alquiler en el marketplace. Obtienes un codificador agéntico de clase 295B con pesos abiertos por aproximadamente el precio de una suscripción a Claude Pro, y los pesos nunca salen de tu máquina alquilada.
{% endhint %}

***

## Casos de uso

* **Agentes SWE autónomos** — 74.4% SWE-bench Verified (según el proveedor) y ajuste explícito para bucles largos de llamadas a herramientas; combínalo con OpenHands, SWE-agent o Aider
* **Agentes impulsados por terminal** — 54.4% en Terminal-Bench 2.0 lo coloca en la primera categoría para flujos de trabajo de shell/CLI
* **Razonamiento de largo horizonte** — matemáticas de nivel olimpiada (IMOAnswerBench, FrontierScience-Olympiad) y STEM de nivel doctorado
* **RAG a escala de base de código** — ctx de 256K cabe en un repositorio completo de tamaño medio más las pruebas en un solo prompt
* **Agentes de búsqueda y navegación** — el ajuste de BrowseComp / WideSearch lo convierte en un planificador sólido para investigación web de varios pasos
* **Agente de agentes** — usa Hy3 Preview como planificador y modelos abiertos más ligeros ([Qwen3.5](/guides/guides_v2-es/modelos-de-lenguaje/qwen35.md), [GLM-4.7 Flash](/guides/guides_v2-es/modelos-de-lenguaje/glm-47-flash.md)) como trabajadores

***

## Pruebas comparativas

{% hint style="warning" %}
**Afirmado por el proveedor — verifica de forma independiente.** Todos los números a continuación provienen de la ficha del modelo de Tencent del 13 de abril de 2026. Las reproducciones independientes (especialmente en SWE-bench Verified) aún están llegando. Tómalos como límites superiores hasta que LMSYS / OpenCompass lo confirme.
{% endhint %}

| Benchmark            | Hy3 Preview | GLM-5.1 | DeepSeek R1 | GPT-5.4 |
| -------------------- | ----------- | ------- | ----------- | ------- |
| SWE-bench verificado | **74.4%**   | \~79%   | \~71%       | \~78%   |
| Terminal-Bench 2.0   | **54.4%**   | —       | —           | —       |
| GPQA Diamond         | **87.2%**   | —       | \~84%       | \~88%   |
| SuperGPQA            | 51.6%       | —       | —           | —       |
| HLE                  | \~30        | —       | —           | —       |

Tencent también informa de resultados sólidos en los benchmarks propietarios de aprendizaje de contexto CL-bench / CL-bench-Life y en el examen de doctorado en matemáticas Qiuzhen de Tsinghua (primavera de 2026).

***

## Solución de problemas

| Problema                                            | Solución                                                                                                                                                                             |
| --------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| `OutOfMemoryError` al cargar                        | BF16 necesita \~590GB de VRAM total. Baja a 4×A100 con `--max-model-len 32768` o usa cuantizaciones W4A16 de AngelSlim.                                                              |
| Descarga lenta de HuggingFace                       | Usa `huggingface-cli download tencent/Hy3-preview --local-dir ./weights --resume-download`. Espera 590GB o más.                                                                      |
| Llamadas a herramientas descartadas silenciosamente | Asegúrate de que `--tool-call-parser hy_v3` (vLLM) o `--tool-call-parser hunyuan` (SGLang) está configurado, y `--enable-auto-tool-choice` está activado.                            |
| Traza de razonamiento vacía / incorrecta            | Usa `temperature=0.9, top_p=1.0`. La decodificación codiciosa a temperatura cero rompe la cadena de pensamiento. Confirma `reasoning_effort: "high"`.                                |
| Errores de decodificación especulativa MTP          | Requiere una versión reciente de vLLM (compilación posterior a abril de 2026). Ejecuta `pip install -U vllm --pre` o fija una etiqueta que enumere `mtp` en las notas de la versión. |
| OOM en contexto de 256K                             | Empieza con `--max-model-len 32768`, habilita `--enable-chunked-prefill`, y aumenta gradualmente. El 256K completo necesita de forma realista 8× H200.                               |
| Arquitectura personalizada rechazada                | Siempre pasa `--trust-remote-code`. Hy3 incluye código de modelado personalizado con el checkpoint.                                                                                  |
| Ollama / GGUF no disponible                         | Las cuantizaciones de la comunidad suelen llegar 2–4 semanas después del lanzamiento. Usa vLLM o AngelSlim mientras tanto.                                                           |

***

## Siguientes pasos

* **El par de pesos abiertos más cercano:** [GLM-5.1](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-1.md) — MoE de 744B / 40B activos, licencia MIT, puntuaciones superiores en SWE-bench Pro
* **Alternativa multimodal:** [Qwen3.5-Omni](/guides/guides_v2-es/modelos-de-lenguaje/qwen35-omni.md) — texto + audio + imagen + video, funciona en una sola RTX 4090
* **Alternativa solo de razonamiento:** [DeepSeek R1](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-r1.md) — especialista puro en razonamiento de formato largo
* **Alquila el hardware:** [A100 80GB en bare metal](https://clore.ai/bare-metal) — instancias de 4× A100 80GB de [bare metal](https://clore.ai/bare-metal)
* **Marketplace completo:** [clore.ai/marketplace](https://clore.ai/marketplace) — H100, H200, A100, RTX 5090 desde $0.25–0.77/h

### Enlaces

* [Hy3 Preview en HuggingFace](https://huggingface.co/tencent/Hy3-preview)
* [Repositorio de GitHub de Hy3 Preview](https://github.com/Tencent-Hunyuan/Hy3-preview)
* [Organización Tencent Hunyuan](https://huggingface.co/tencent)
* [documentación de vLLM](https://docs.vllm.ai)
* [repositorio SGLang](https://github.com/sgl-project/sglang)
* [AngelSlim — kit de herramientas de cuantización de Tencent](https://github.com/Tencent/AngelSlim)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/hy3-preview.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
