> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/nemotron-3-ultra.md).

# NVIDIA Nemotron 3 Ultra (550B Mamba-MoE)

Exécutez NVIDIA Nemotron 3 Ultra, l'hybride ouvert Mamba-MoE de 550B, sur des configurations Blackwell du marketplace Clore.ai

{% hint style="info" %}
**Statut (août 2026) :** NVIDIA a annoncé **Nemotron 3 Ultra** au Computex le **4 juin 2026** et l’a publié sous la **OpenMDW-1.1** licence — poids, données d’entraînement, recette et environnement d’apprentissage par renforcement. **550B au total / 55B actifs**, hybride **Mamba-2 + MoE + attention** architecture avec prédiction multi-token, contexte jusqu’à **1M tokens**. Poids : [nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) et une version officielle [build NVFP4](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4).
{% endhint %}

Deux choses distinguent cette sortie de la vague chinoise de modèles à poids ouverts. Premièrement, **la licence est exceptionnellement complète**: OpenMDW-1.1 couvre le modèle, les données et la recette, donc l’ensemble du pipeline est reproductible, et pas seulement le checkpoint. Deuxièmement, **l’architecture n’est pas un simple transformer** — des couches d’espace d’états Mamba-2 entrelacées avec MoE et des couches d’attention sélectionnées, d’où le fait que NVIDIA annonce un débit bien supérieur à ce qu’un modèle à attention dense de 550B fournirait.

Pour les locataires de Clore.ai, il y a une belle adéquation : la version officielle **NVFP4** du checkpoint est conçue pour Blackwell, et les plus grosses configurations sur la place de marché sont des 4× RTX PRO 6000 Blackwell (380GB).

### Spécifications clés

| Propriété         | Valeur                                                                      |
| ----------------- | --------------------------------------------------------------------------- |
| Paramètres        | 550B au total, 55B actifs                                                   |
| Architecture      | LatentMoE — hybride Mamba-2 + MoE + attention, MTP, 512 experts (22 actifs) |
| Contexte          | Jusqu’à 1 000 000 de tokens                                                 |
| Licence           | OpenMDW-1.1 (modèle, données, recette, environnement RL)                    |
| Date de sortie    | 4 juin 2026                                                                 |
| Poids             | NVFP4 352GB · Q2\_K\_XL GGUF 202GB · Q3\_K\_M GGUF 274GB                    |
| Outils principaux | vLLM, SGLang, TensorRT-LLM, llama.cpp                                       |

***

## Exigences

| Version        | Taille  | configuration Clore.ai                                     |
| -------------- | ------- | ---------------------------------------------------------- |
| `UD-IQ1_M`     | 188GB   | 8× RTX 5090 (248GB)                                        |
| `UD-Q2_K_XL`   | 202GB   | 8× RTX 5090 (248GB) — 47 serveurs à ≥242GB                 |
| `UD-Q3_K_M`    | 274GB   | 10× RTX 5090 (310 Go) ou 4× RTX PRO 6000 (380 Go)          |
| NVFP4 officiel | 352GB   | 4× RTX PRO 6000 Blackwell (380GB) — 2 serveurs répertoriés |
| BF16 officiel  | \~1.1TB | [bare metal](https://clore.ai/bare-metal)                  |

{% hint style="warning" %}
**NVFP4 nécessite Blackwell.** Les cœurs tensoriels FP4 existent sur les RTX série 50 et RTX PRO 6000, pas sur Ada ni Ampere. Sur une configuration 4090 ou 3090, utilisez plutôt les builds GGUF. Voir [Compatibilité CUDA et PyTorch](/guides/guides_v2-fr/premiers-pas/cuda-pytorch-compatibility.md).
{% endhint %}

***

## Déployer

**NVFP4 sur une configuration Blackwell (vLLM) :**

```bash
vllm serve nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 \\
  --tensor-parallel-size 4 \
  --trust-remote-code \\
  --max-model-len 262144 \\
  --gpu-memory-utilization 0.90 \\
  --enable-expert-parallel
```

**GGUF sur une configuration RTX 5090 (llama.cpp) :**

```bash
huggingface-cli download unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/nemotron

llama-server -m /workspace/nemotron/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \
  -ngl 999 --split-mode layer -c 131072 --flash-attn --no-mmap
```

Le raisonnement est un indicateur du modèle de chat : le modèle produit une trace de raisonnement avant sa réponse, et vous pouvez désactiver cela pour les appels sensibles à la latence.

Autres checkpoints préconstruits : [`RedHatAI/...-FP8-dynamic`](https://huggingface.co/RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-FP8-dynamic) et [`RedHatAI/...-quantized.w4a16`](https://huggingface.co/RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-quantized.w4a16).

***

## Recommandations GPU Clore.ai

| Configuration                 | VRAM totale | Version            | Coût Clore.ai   |
| ----------------------------- | ----------- | ------------------ | --------------- |
| 8× RTX 5090                   | 248 Go      | Q2\_K\_XL GGUF     | \~2,00–3,50 $/h |
| 10× RTX 5090                  | 310 Go      | Q3\_K\_M GGUF      | \~5,00 $/h      |
| **4× RTX PRO 6000 Blackwell** | **380 Go**  | **NVFP4 officiel** | **\~5,00 $/h**  |

***

## Cas d’usage

* **Agents de longue durée** — NVIDIA a conçu l’environnement RL exactement pour cela et l’a fourni avec les poids
* **Recherche reproductible** — les données et la recette sont couvertes par la licence, donc les résultats peuvent être reconstruits, et pas seulement rejoués
* **Raisonnement à haut débit** — l’hybride Mamba décode plus vite qu’un modèle à attention dense de taille comparable
* **RAG à forts enjeux** — un long contexte plus une trace de raisonnement que vous pouvez examiner
* **Poids ouverts relevant de la juridiction américaine** — le modèle à poids ouverts développé aux États-Unis le plus puissant de l’été, là où cela compte pour les achats

***

## Dépannage

| Problème                                   | Correctif                                                                                                |
| ------------------------------------------ | -------------------------------------------------------------------------------------------------------- |
| Échec du chargement de NVFP4               | La configuration n’est pas Blackwell — utilisez GGUF ou un build FP8                                     |
| `nemotron_h` architecture inconnue         | Mettez à jour vLLM/SGLang/llama.cpp ; les couches hybrides Mamba nécessitent une prise en charge récente |
| Traces de raisonnement dans chaque réponse | Désactivez l’indicateur de raisonnement dans le modèle de chat pour les appels à faible latence          |
| Débit inférieur aux attentes               | Activez le décodage spéculatif basé sur MTP ; le modèle intègre des couches MTP                          |
| OOM sur 8× 5090 en Q3                      | Q3\_K\_M fait 274GB — il vous faut plus de 310GB de VRAM                                                 |

***

## Étapes suivantes

* **Petit frère :** [Nemotron 3 Super](/guides/guides_v2-fr/modeles-de-langage/nvidia-nemotron-3-super.md) — MoE 120B, tient sur des configurations bien plus petites
* **Même catégorie de taille :** [GLM-5.2](/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md) · [MiniMax M3](/guides/guides_v2-fr/modeles-de-langage/minimax-m3.md) · [DeepSeek V4](/guides/guides_v2-fr/modeles-de-langage/deepseek-v4.md)
* **Alternative sur une seule carte :** [Qwen3.8-27B](/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md)
* **Déploiement :** [TensorRT-LLM](/guides/guides_v2-fr/devops-gpu/tensorrt-llm.md) · [vLLM](/guides/guides_v2-fr/modeles-de-langage/vllm.md)

### Liens

* [Nemotron 3 Ultra BF16](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) · [NVFP4](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4) · [GGUF](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF)
* [licence OpenMDW-1.1](https://openmdw.ai/license/1-1/)
* **Louez un GPU :** [RTX 5090](https://clore.ai/rent-5090.html) · [Place de marché](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/nemotron-3-ultra.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
