> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/nemotron-3-ultra.md).

# NVIDIA Nemotron 3 Ultra (550B Mamba-MoE)

Ejecuta NVIDIA Nemotron 3 Ultra, el híbrido abierto Mamba-MoE de 550B, en rigs Blackwell del marketplace de Clore.ai

{% hint style="info" %}
**Estado (agosto de 2026):** NVIDIA anunció **Nemotron 3 Ultra** en Computex el **4 de junio de 2026** y lo lanzó bajo la **OpenMDW-1.1** licencia — pesos, datos de entrenamiento, receta y el entorno de aprendizaje por refuerzo. **550B en total / 55B activos**, híbrido **Mamba-2 + MoE + atención** arquitectura con predicción de múltiples tokens, contexto de hasta **1M de tokens**. Pesos: [nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) y una [compilación oficial NVFP4](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4).
{% endhint %}

Dos cosas distinguen esta versión de la ola china de pesos abiertos. Primero, **la licencia es inusualmente completa**: OpenMDW-1.1 cubre el modelo, los datos y la receta, así que todo el canal es reproducible y no solo el checkpoint. Segundo, **la arquitectura no es un transformer simple** — capas de espacio de estados Mamba-2 entrelazadas con MoE y capas selectas de atención, por lo que NVIDIA cita un rendimiento muy superior al que daría un modelo de atención densa de 550B.

Para los arrendatarios de Clore.ai hay una buena compatibilidad: el **NVFP4** checkpoint oficial está diseñado para Blackwell, y los rigs más grandes del marketplace son 4× RTX PRO 6000 Blackwell (380GB).

### Especificaciones clave

| Propiedad                | Valor                                                                        |
| ------------------------ | ---------------------------------------------------------------------------- |
| Parámetros               | 550B en total, 55B activos                                                   |
| Arquitectura             | LatentMoE — híbrido Mamba-2 + MoE + atención, MTP, 512 expertos (22 activos) |
| Contexto                 | Hasta 1.000.000 de tokens                                                    |
| Licencia                 | OpenMDW-1.1 (modelo, datos, receta, entorno RL)                              |
| Fecha de lanzamiento     | 4 de junio de 2026                                                           |
| Pesos                    | NVFP4 352GB · Q2\_K\_XL GGUF 202GB · Q3\_K\_M GGUF 274GB                     |
| Herramientas principales | vLLM, SGLang, TensorRT-LLM, llama.cpp                                        |

***

## Requisitos

| Versión       | Tamaño  | rig de Clore.ai                                           |
| ------------- | ------- | --------------------------------------------------------- |
| `UD-IQ1_M`    | 188GB   | 8× RTX 5090 (248GB)                                       |
| `UD-Q2_K_XL`  | 202GB   | 8× RTX 5090 (248GB) — 47 servidores con ≥242GB            |
| `UD-Q3_K_M`   | 274GB   | 10× RTX 5090 (310 GB) o 4× RTX PRO 6000 (380 GB)          |
| NVFP4 oficial | 352GB   | 4× RTX PRO 6000 Blackwell (380GB) — 2 servidores listados |
| BF16 oficial  | \~1.1TB | [bare metal](https://clore.ai/bare-metal)                 |

{% hint style="warning" %}
**NVFP4 requiere Blackwell.** Los tensor cores FP4 existen en la serie RTX 50 y RTX PRO 6000, no en Ada ni en Ampere. En un rig con 4090 o 3090, usa en su lugar las compilaciones GGUF. Ver [Compatibilidad de CUDA y PyTorch](/guides/guides_v2-es/primeros-pasos/cuda-pytorch-compatibility.md).
{% endhint %}

***

## Implementar

**NVFP4 en un rig Blackwell (vLLM):**

```bash
vllm serve nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 \
  --tensor-parallel-size 4 \\
  --trust-remote-code \\
  --max-model-len 262144 \\
  --gpu-memory-utilization 0.90 \\
  --enable-expert-parallel
```

**GGUF en un rig RTX 5090 (llama.cpp):**

```bash
huggingface-cli download unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF \
  --include "*UD-Q2_K_XL*" --local-dir /workspace/nemotron

llama-server -m /workspace/nemotron/*UD-Q2_K_XL*-00001-of-*.gguf \
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer -c 131072 --flash-attn --no-mmap
```

Reasoning es una bandera de la plantilla de chat: el modelo emite una traza de razonamiento antes de su respuesta, y puedes desactivarla para llamadas sensibles a la latencia.

Otros checkpoints precompilados: [`RedHatAI/...-FP8-dynamic`](https://huggingface.co/RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-FP8-dynamic) y [`RedHatAI/...-quantized.w4a16`](https://huggingface.co/RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-quantized.w4a16).

***

## Recomendaciones de GPU para Clore.ai

| Configuración                 | VRAM total | Versión           | Coste en Clore.ai |
| ----------------------------- | ---------- | ----------------- | ----------------- |
| 8× RTX 5090                   | 248 GB     | Q2\_K\_XL GGUF    | \~$2.00–3.50/h    |
| 10× RTX 5090                  | 310 GB     | Q3\_K\_M GGUF     | \~$5.00/h         |
| **4× RTX PRO 6000 Blackwell** | **380 GB** | **NVFP4 oficial** | **\~$5.00/h**     |

***

## Casos de uso

* **Agentes de larga duración** — NVIDIA construyó el entorno RL exactamente para esto y lo incluyó con los pesos
* **Investigación reproducible** — los datos y la receta están cubiertos por la licencia, así que los resultados pueden reconstruirse, no solo reproducirse
* **Razonamiento de alto rendimiento** — el híbrido Mamba decodifica más rápido que un modelo de atención densa de tamaño comparable
* **RAG de alto riesgo** — contexto largo más una traza de razonamiento que puedes inspeccionar
* **pesos abiertos bajo jurisdicción de EE. UU.** — el modelo de pesos abiertos desarrollado en EE. UU. más potente del verano, donde eso importa para las adquisiciones

***

## Solución de problemas

| Problema                                 | Solución                                                                                    |
| ---------------------------------------- | ------------------------------------------------------------------------------------------- |
| NVFP4 no se carga                        | El rig no es Blackwell — usa GGUF o una compilación FP8                                     |
| `nemotron_h` arquitectura desconocida    | Actualiza vLLM/SGLang/llama.cpp; las capas híbridas Mamba necesitan soporte reciente        |
| Trazas de razonamiento en cada respuesta | Desactiva la bandera de razonamiento en la plantilla de chat para llamadas de baja latencia |
| Rendimiento inferior al esperado         | Habilita la decodificación especulativa basada en MTP; el modelo incluye capas MTP          |
| OOM en 8× 5090 en Q3                     | Q3\_K\_M son 274GB — necesitas más de 310GB de VRAM                                         |

***

## Siguientes pasos

* **Hermano menor:** [Nemotron 3 Super](/guides/guides_v2-es/modelos-de-lenguaje/nvidia-nemotron-3-super.md) — 120B MoE, cabe en rigs mucho más pequeños
* **Misma categoría de tamaño:** [GLM-5.2](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md) · [MiniMax M3](/guides/guides_v2-es/modelos-de-lenguaje/minimax-m3.md) · [DeepSeek V4](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v4.md)
* **Alternativa de una sola tarjeta:** [Qwen3.8-27B](/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md)
* **Servir:** [TensorRT-LLM](/guides/guides_v2-es/devops-con-gpu/tensorrt-llm.md) · [vLLM](/guides/guides_v2-es/modelos-de-lenguaje/vllm.md)

### Enlaces

* [Nemotron 3 Ultra BF16](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) · [NVFP4](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4) · [GGUF](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF)
* [licencia OpenMDW-1.1](https://openmdw.ai/license/1-1/)
* **Alquila una GPU:** [RTX 5090](https://clore.ai/rent-5090.html) · [Marketplace](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/nemotron-3-ultra.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
