> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/nemotron-3-ultra.md).

# NVIDIA Nemotron 3 Ultra (550B Mamba-MoE)

Запустите NVIDIA Nemotron 3 Ultra, открытый гибрид Mamba-MoE на 550B, на Blackwell-ригах из маркетплейса Clore.ai

{% hint style="info" %}
**Статус (август 2026):** NVIDIA объявила **Nemotron 3 Ultra** на Computex **4 июня 2026 года** и выпустила его под **OpenMDW-1.1** лицензией — веса, обучающие данные, рецепт и среда обучения с подкреплением. **550B всего / 55B активных**, гибридная **Mamba-2 + MoE + attention** архитектура с предсказанием нескольких токенов, контекст до **1 млн токенов**. Веса: [nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) и официальная [сборка NVFP4](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4).
{% endhint %}

Две вещи отличают этот релиз от китайской волны открытых весов. Во-первых, **лицензия необычайно полная**: OpenMDW-1.1 охватывает модель, данные и рецепт, так что весь конвейер воспроизводим, а не только чекпойнт. Во-вторых, **архитектура — не обычный трансформер** — чередующиеся слои Mamba-2 state-space с MoE и выборочными attention-слоями, поэтому NVIDIA указывает пропускную способность значительно выше, чем дала бы плотная модель на 550B.

Для арендующих на Clore.ai это хорошо подходит: официальная **NVFP4** чекпойнт собран под Blackwell, а самые большие риги на маркетплейсе — это 4× RTX PRO 6000 Blackwell (380 ГБ).

### Ключевые характеристики

| Параметр             | Значение                                                                       |
| -------------------- | ------------------------------------------------------------------------------ |
| Параметры            | 550B всего, 55B активных                                                       |
| Архитектура          | LatentMoE — гибрид Mamba-2 + MoE + attention, MTP, 512 экспертов (22 активных) |
| Контекст             | До 1 000 000 токенов                                                           |
| Лицензия             | OpenMDW-1.1 (модель, данные, рецепт, RL-среда)                                 |
| Дата выпуска         | 4 июня 2026 года                                                               |
| Веса                 | NVFP4 352 ГБ · Q2\_K\_XL GGUF 202 ГБ · Q3\_K\_M GGUF 274 ГБ                    |
| Основные инструменты | vLLM, SGLang, TensorRT-LLM, llama.cpp                                          |

***

## Требования

| Сборка                   | Размер   | риг Clore.ai                                           |
| ------------------------ | -------- | ------------------------------------------------------ |
| `UD-IQ1_M`               | 188 ГБ   | 8× RTX 5090 (248 ГБ)                                   |
| `UD-Q2_K_XL`             | 202 ГБ   | 8× RTX 5090 (248 ГБ) — 47 серверов с ≥242 ГБ           |
| `UD-Q3_K_M`              | 274 ГБ   | 10× RTX 5090 (310 ГБ) или 4× RTX PRO 6000 (380 ГБ)     |
| официальная сборка NVFP4 | 352 ГБ   | 4× RTX PRO 6000 Blackwell (380 ГБ) — указано 2 сервера |
| официальная BF16-сборка  | \~1,1 ТБ | [голое железо](https://clore.ai/bare-metal)            |

{% hint style="warning" %}
**NVFP4 требует Blackwell.** Тензорные ядра FP4 есть на RTX 50-й серии и RTX PRO 6000, но не на Ada или Ampere. На риге с 4090 или 3090 используйте сборки GGUF. См. [Совместимость CUDA и PyTorch](/guides/guides_v2-ru/nachalo-raboty/cuda-pytorch-compatibility.md).
{% endhint %}

***

## Развернуть

**NVFP4 на риге Blackwell (vLLM):**

```bash
vllm serve nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 \\
  --tensor-parallel-size 4 \
  --trust-remote-code \\
  --max-model-len 262144 \\
  --gpu-memory-utilization 0.90 \
  --enable-expert-parallel
```

**GGUF на риге с RTX 5090 (llama.cpp):**

```bash
huggingface-cli download unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/nemotron

llama-server -m /workspace/nemotron/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer -c 131072 --flash-attn --no-mmap
```

Reasoning — это флаг шаблона чата: модель выводит цепочку рассуждений перед ответом, и это можно отключить для запросов, чувствительных к задержке.

Другие готовые чекпойнты: [`RedHatAI/...-FP8-dynamic`](https://huggingface.co/RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-FP8-dynamic) и [`RedHatAI/...-quantized.w4a16`](https://huggingface.co/RedHatAI/NVIDIA-Nemotron-3-Ultra-550B-A55B-quantized.w4a16).

***

## Рекомендации по GPU для Clore.ai

| Конфигурация                  | Общий объём VRAM | Сборка                       | Стоимость Clore.ai |
| ----------------------------- | ---------------- | ---------------------------- | ------------------ |
| 8× RTX 5090                   | 248 ГБ           | Q2\_K\_XL GGUF               | \~2,00–3,50 $/ч    |
| 10× RTX 5090                  | 310 ГБ           | Q3\_K\_M GGUF                | \~$5.00/ч          |
| **4× RTX PRO 6000 Blackwell** | **380 ГБ**       | **официальная сборка NVFP4** | **\~$5.00/ч**      |

***

## Сценарии использования

* **Долго работающие агенты** — NVIDIA создала среду RL именно для этого и поставила её вместе с весами
* **Воспроизводимые исследования** — данные и рецепт покрываются лицензией, так что результаты можно воссоздать, а не только повторить
* **Высокопроизводительное reasoning** — гибрид Mamba декодирует быстрее, чем модель с сопоставимым размером и плотным attention
* **RAG для задач с высокими ставками** — длинный контекст плюс цепочка рассуждений, которую можно проверить
* **Открытые веса под юрисдикцией США** — сильнейшая из разработанных в США моделей с открытыми весами этим летом, там, где это важно с точки зрения закупок

***

## Устранение неполадок

| Проблема                             | Исправьте                                                                             |
| ------------------------------------ | ------------------------------------------------------------------------------------- |
| NVFP4 не загружается                 | Риг не Blackwell — используйте GGUF или сборку FP8                                    |
| `nemotron_h` архитектура неизвестна  | Обновите vLLM/SGLang/llama.cpp; гибридным слоям Mamba нужна свежая поддержка          |
| Цепочки рассуждений в каждом ответе  | Отключите флаг reasoning в шаблоне чата для запросов с низкой задержкой               |
| Пропускная способность ниже ожиданий | Включите спекулятивное декодирование на основе MTP; модель поставляется со слоями MTP |
| OOM на 8× 5090 при Q3                | Q3\_K\_M — это 274 ГБ; вам нужно 310+ ГБ VRAM                                         |

***

## Дальнейшие шаги

* **Младший собрат:** [Nemotron 3 Super](/guides/guides_v2-ru/yazykovye-modeli/nvidia-nemotron-3-super.md) — 120B MoE, помещается на гораздо более скромных ригах
* **Та же категория по размеру:** [GLM-5.2](/guides/guides_v2-ru/yazykovye-modeli/glm-5-2.md) · [MiniMax M3](/guides/guides_v2-ru/yazykovye-modeli/minimax-m3.md) · [DeepSeek V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md)
* **Однокарточная альтернатива:** [Qwen3.8-27B](/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md)
* **Развёртывание:** [TensorRT-LLM](/guides/guides_v2-ru/gpu-devops/tensorrt-llm.md) · [vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md)

### Ссылки

* [Nemotron 3 Ultra BF16](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) · [NVFP4](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4) · [GGUF](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF)
* [лицензия OpenMDW-1.1](https://openmdw.ai/license/1-1/)
* **Арендовать GPU:** [RTX 5090](https://clore.ai/rent-5090.html) · [Маркетплейс](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/nemotron-3-ultra.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
