> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/nvidia-nemotron-3-super.md).

# NVIDIA Nemotron 3 Super (120B MoE)

> **Nemotron 3 Super** — это открытая модель NVIDIA типа Mixture-of-Experts Hybrid Mamba-Transformer с общим числом параметров 120B / активных 12B, выпущенная 11 марта 2026 года. Специально разработана для сложных **агентных ИИ-систем** — автономного программирования, триажа в кибербезопасности и длительных многошаговых исследований. Обеспечивает **в 5× более высокую пропускную способность** по сравнению с плотными моделями сопоставимого качества.

## Зачем запускать Nemotron 3 Super на Clore.ai?

Архитектура MoE у Nemotron 3 Super означает, что при каждом прямом проходе активны только 12B параметров — поэтому вы получаете рассуждения уровня передового края по вычислительной цене модели среднего размера. На Clore.ai вы можете арендовать одну RTX 5090 (32 ГБ) или пару RTX 4090 и запускать её с полной квантизацией INT4/FP4 на производительных скоростях.

**Ключевые цифры:**

* **120B параметров всего**, 12B активных (Latent MoE)
* **гибридная архитектура Mamba-Transformer** (первая в линейке Nemotron с MTP Layers)
* **контекстное окно на 1M токенов**
* Предобучена в **NVFP4** — нативная квантизация NVIDIA FP4
* **в 5× выше пропускная способность** по сравнению с сопоставимыми плотными моделями
* Лицензия NVIDIA Nemotron Open Model License — открытые веса с коммерческим использованием

## Требования к оборудованию

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

| Конфигурация   | VRAM              | Стоимость на Clore.ai                       | Примечания                    |
| -------------- | ----------------- | ------------------------------------------- | ----------------------------- |
| FP4 (нативный) | 1× RTX 5090 32GB  | $0.25–0.77/ч                                | Самый быстрый; нативный NVFP4 |
| INT4           | 2× RTX 4090 24 ГБ | $0.28–0.84/ч                                | Сильный вариант               |
| INT4           | 1× A100 80GB      | [голое железо](https://clore.ai/bare-metal) | Полный INT4, один GPU         |
| INT8           | 4× RTX 4090       | $0.56–1.68/ч                                | Почти полное качество         |
| BF16, полный   | 4× H100 80 ГБ     | \~$4.16/ч                                   | Обучение / полная точность    |

> **Лучшее соотношение цены и качества на Clore.ai:** 2× RTX 5090 (доступно от $0.50–1.54/ч) для инференса BF16 в полной точности.

## Быстрый старт: vLLM + Nemotron 3 Super

```bash
# Загрузите Docker-образ vLLM (поддержка NVFP4 требует vLLM >= 0.7.3)
docker run --gpus all --rm -it \\
  -p 8000:8000 \\
  -v /root/.cache:/root/.cache \
  vllm/vllm-openai:v0.7.3 \
  --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
  --quantization fp4 \
  --max-model-len 32768 \
  --tensor-parallel-size 1 \\
  --gpu-memory-utilization 0.92
```

Для многопроцессорного GPU (2× RTX 4090 в INT4):

```bash
docker run --gpus all --rm -it \\
  -p 8000:8000 \\
  -v /root/.cache:/root/.cache \
  vllm/vllm-openai:v0.7.3 \
  --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
  --quantization awq_marlin \\
  --max-model-len 65536 \\
  --tensor-parallel-size 2 \
  --gpu-memory-utilization 0.90
```

## SGLang (альтернатива — более быстрый сервис MoE)

Для MoE-пропускной способности производственного уровня RadixAttention в SGLang даёт в 2–5× лучшую пропускную способность по сравнению с vLLM на MoE-моделях:

```bash
docker run --gpus all --rm -it \\
  -p 30000:30000 \
  -v /root/.cache:/root/.cache \
  lmsysorg/sglang:latest \
  python -m sglang.launch_server \
    --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
    --tp 2 \
    --quantization fp8 \
    --context-length 131072 \
    --port 30000
```

## Развёртывание на Clore.ai: пошагово

### 1. Арендуйте GPU

Перейдите на [clore.ai/marketplace](https://clore.ai/marketplace):

* Фильтр: **RTX 5090** или **RTX 4090 × 2+**
* Отсортируйте по цене (spot примерно на трети серверов выгоднее on-demand, медиана \~13% скидки)
* Минимум: 32 ГБ VRAM всего (FP4); 48 ГБ для INT8; 80 ГБ для BF16

### 2. Запустите контейнер

В панели Clore.ai выберите **Custom Docker** и введите:

```
Образ: vllm/vllm-openai:v0.7.3
Порты: 8000
Команда: --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 --quantization fp4 --max-model-len 32768
```

Или используйте запуск одной командой по SSH:

```bash
ssh root@<clore-server-ip> "docker run --gpus all -d \
  -p 8000:8000 \\
  -v /root/.cache:/root/.cache \
  --name nemotron3 \
  vllm/vllm-openai:v0.7.3 \
  --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
  --quantization fp4 \
  --max-model-len 32768 && echo 'Started'"
```

### 3. Проверьте API

```bash
curl http://<server-ip>:8000/v1/chat/completions \
  -H "Content-Type: application/json" \\
  -d '{
    "model": "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
    "messages": [
      {"role": "system", "content": "Вы — полезный помощник."},
      {"role": "user", "content": "Напиши функцию на Python для парсинга issues GitHub и категоризации их по степени серьёзности."}
    ],
    "max_tokens": 2048,
    "temperature": 0.1
  }'
```

## Сценарий использования агентной системы: многоагентный конвейер разработки

Nemotron 3 Super создан специально для многоагентных рабочих процессов. Вот минимальный пример с использованием API, совместимого с OpenAI:

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://<server-ip>:8000/v1",
    api_key="none"
)

def planning_agent(task: str) -> str:
    """Высокоуровневое декомпозирование задачи."""
    response = client.chat.completions.create(
        model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
        messages=[
            {"role": "system", "content": "Вы — ведущий инженер. Разбивайте сложные задачи на конкретные подзадачи с критериями приёмки."},
            {"role": "user", "content": f"Декомпозируй эту задачу: {task}"}
        ],
        max_tokens=1024,
        temperature=0.0
    )
    return response.choices[0].message.content

def coding_agent(subtask: str) -> str:
    """Реализация кода."""
    response = client.chat.completions.create(
        model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
        messages=[
            {"role": "system", "content": "Вы — эксперт по Python. Пишите production-качественный код с тестами."},
            {"role": "user", "content": subtask}
        ],
        max_tokens=2048,
        temperature=0.1
    )
    return response.choices[0].message.content

# Пример: автономная реализация функциональности
plan = planning_agent("Создать REST API для аутентификации пользователей с JWT")
print("План:", plan)
code = coding_agent(f"Реализуй шаг 1 из этого плана: {plan}")
print("Код:", code)
```

## Бенчмарки (март 2026)

| Бенчмарк                       | Nemotron 3 Super | DeepSeek V3 | Llama 4 Maverick |
| ------------------------------ | ---------------- | ----------- | ---------------- |
| HumanEval                      | 92.1%            | 90.8%       | 88.4%            |
| MATH-500                       | 89.3%            | 90.2%       | 84.7%            |
| SWE-bench Verified             | 65.2%            | 61.4%       | 55.8%            |
| MMLU                           | 88.7%            | 87.2%       | 86.1%            |
| Пропускная способность (ток/с) | 1,840            | 410         | 890              |

*Пропускная способность измерена на 2× H100 80 ГБ с квантизацией INT4.*

## Мониторинг и советы для продакшена

```bash
# Следите за памятью и загрузкой GPU
watch -n2 nvidia-smi

# Проверьте статистику пропускной способности vLLM
curl http://localhost:8000/metrics 2>/dev/null | grep vllm

# Логи Docker (в реальном времени)
docker logs -f nemotron3

# Если OOM: уменьшите max_model_len или увеличьте tensor-parallel-size
```

**Рекомендуемые настройки для продакшена на Clore.ai:**

* `--max-model-len 32768` для большинства нагрузок (экономит VRAM, покрывает 95% запросов)
* `--gpu-memory-utilization 0.90` (оставьте запас 10% на накладные расходы маршрутизации MoE)
* `--enable-chunked-prefill` для меньшей задержки на длинных входах
* Включите spot-заказы для экономии 30–40% на пакетных нагрузках

## Сравнение стоимости

| Провайдер                | Конфигурация    | $/ч      |
| ------------------------ | --------------- | -------- |
| **Clore.ai** (spot)      | 2× RTX 5090     | \~$5.60  |
| **Clore.ai** (on-demand) | 2× RTX 5090     | \~$7.00  |
| Azure AI                 | Размещённый API | \~$15–20 |
| NVIDIA API               | Размещённый API | \~$12–18 |

*Самостоятельный хостинг на Clore.ai в 2–3× дешевле, чем управляемый API, для постоянных нагрузок.*

## Связанные руководства

* [Обслуживание vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) — производственный LLM-сервер с API, совместимым с OpenAI
* [SGLang](/guides/guides_v2-ru/yazykovye-modeli/sglang.md) — более высокая пропускная способность MoE с RadixAttention
* [DeepSeek V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md) — грядущая открытая модель с 1T параметров
* [CrewAI](/guides/guides_v2-ru/platformy-i-agenty-ii/crewai.md) — создавайте многоагентные конвейеры с агентами на основе ролей
* [OpenHands](/guides/guides_v2-ru/platformy-i-agenty-ii/openhands.md) — автономные агенты для разработки ПО
* [Сравнение GPU](/guides/guides_v2-ru/nachalo-raboty/gpu-comparison.md) — подберите подходящий GPU для вашей нагрузки

***

*Последнее обновление: 16 марта 2026 | Модель выпущена: 11 марта 2026 | Лицензия: NVIDIA Nemotron Open Model License*


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/nvidia-nemotron-3-super.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
