> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/language-models/nvidia-nemotron-3-super.md).

# NVIDIA Nemotron 3 Super (120B MoE)

> **Nemotron 3 Super** यह NVIDIA का ओपन-सोर्स 120B-कुल / 12B-सक्रिय Mixture-of-Experts हाइब्रिड Mamba-Transformer मॉडल है, जिसे 11 मार्च, 2026 को जारी किया गया। विशेष रूप से जटिल **एजेंटिक AI प्रणालियाँ** — स्वायत्त कोडिंग, साइबरसुरक्षा ट्रायाज, और लंबे-रूप वाले बहु-चरणीय शोध के लिए। प्रदान करता है **5× अधिक थ्रूपुट** समकक्ष गुणवत्ता वाले dense मॉडलों की तुलना में।

## Clore.ai पर Nemotron 3 Super क्यों चलाएँ?

Nemotron 3 Super की MoE आर्किटेक्चर का मतलब है कि हर फ़ॉरवर्ड पास में केवल 12B पैरामीटर सक्रिय होते हैं — इसलिए आपको मध्य-आकार के मॉडल की कंप्यूट लागत पर अत्याधुनिक स्तर की तर्क-क्षमता मिलती है। Clore.ai पर आप एक अकेला RTX 5090 (32GB) या RTX 4090s की एक जोड़ी किराए पर लेकर इसे पूर्ण INT4/FP4 क्वांटाइज़ेशन के साथ उत्पादन गति पर चला सकते हैं।

**मुख्य आंकड़े:**

* **120B कुल पैरामीटर**, 12B सक्रिय (Latent MoE)
* **हाइब्रिड Mamba-Transformer** आर्किटेक्चर (Nemotron लाइन में MTP Layers के साथ पहली)
* **1M टोकन संदर्भ विंडो**
* में प्री-ट्रेन किया गया **NVFP4** — एनवीडिया का मूल FP4 क्वांटाइज़ेशन
* **5× थ्रूपुट** समकक्ष dense मॉडलों की तुलना में
* NVIDIA Nemotron Open Model License — व्यावसायिक उपयोग के साथ खुले वज़न

## हार्डवेयर आवश्यकताएँ

{% hint style="warning" %}
**Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं।** आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता [bare metal](https://clore.ai/bare-metal) के रूप में अनुरोध पर बेची जाती है। देखें [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md) किसी deployment का आकार तय करने से पहले।
{% endhint %}

| कॉन्फ़िगरेशन | VRAM             | Clore.ai लागत                             | नोट्स                    |
| ------------ | ---------------- | ----------------------------------------- | ------------------------ |
| FP4 (मूल)    | 1× RTX 5090 32GB | $0.25–0.77/घंटा                           | सबसे तेज़; मूल NVFP4     |
| INT4         | 2× RTX 4090 24GB | $0.28–0.84/hr                             | मजबूत विकल्प             |
| INT4         | 1× A100 80GB     | [bare metal](https://clore.ai/bare-metal) | पूर्ण INT4, एकल GPU      |
| INT8         | 4× RTX 4090      | $0.56–1.68/hr                             | लगभग पूर्ण गुणवत्ता      |
| पूर्ण BF16   | 4× H100 80GB     | \~$4.16/घंटा                              | प्रशिक्षण / पूर्ण निष्ठा |

> **Clore.ai पर सबसे बेहतर मूल्य:** BF16 पूर्ण-परिशुद्धता इनफ़ेरेंस के लिए 2× RTX 5090 (मूल्य $0.50–1.54/hr से उपलब्ध)।

## त्वरित शुरुआत: vLLM + Nemotron 3 Super

```bash
# vLLM Docker इमेज खींचें (NVFP4 समर्थन के लिए vLLM >= 0.7.3 आवश्यक है)
docker run --gpus all --rm -it \\
  -p 8000:8000 \
  -v /root/.cache:/root/.cache \
  vllm/vllm-openai:v0.7.3 \
  --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
  --quantization fp4 \
  --max-model-len 32768 \\
  --tensor-parallel-size 1 \
  --gpu-memory-utilization 0.92
```

मल्टी-GPU के लिए (INT4 में 2× RTX 4090):

```bash
docker run --gpus all --rm -it \\
  -p 8000:8000 \
  -v /root/.cache:/root/.cache \
  vllm/vllm-openai:v0.7.3 \
  --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
  --quantization awq_marlin \\
  --max-model-len 65536 \\
  --tensor-parallel-size 2 \\
  --gpu-memory-utilization 0.90
```

## SGLang (विकल्प — तेज़ MoE सर्विंग)

प्रोडक्शन-ग्रेड MoE थ्रूपुट के लिए, SGLang का RadixAttention MoE मॉडलों पर vLLM की तुलना में 2–5× बेहतर थ्रूपुट देता है:

```bash
docker run --gpus all --rm -it \\
  -p 30000:30000 \
  -v /root/.cache:/root/.cache \
  lmsysorg/sglang:latest \
  python -m sglang.launch_server \
    --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
    --tp 2 \
    --quantization fp8 \
    --context-length 131072 \
    --port 30000
```

## Clore.ai पर तैनाती: चरण-दर-चरण

### 1. GPU किराए पर लें

पर जाएँ [clore.ai/marketplace](https://clore.ai/marketplace):

* फ़िल्टर: **RTX 5090** या **RTX 4090 × 2+**
* मूल्य के अनुसार क्रमबद्ध करें (spot लगभग एक-तिहाई सर्वरों पर on-demand से बेहतर है, मध्य \~13% छूट)
* न्यूनतम: कुल 32GB VRAM (FP4); INT8 के लिए 48GB; BF16 के लिए 80GB

### 2. कंटेनर लॉन्च करें

Clore.ai डैशबोर्ड में चुनें **कस्टम Docker** और दर्ज करें:

```
इमेज: vllm/vllm-openai:v0.7.3
पोर्ट्स: 8000
कमांड: --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 --quantization fp4 --max-model-len 32768
```

या एक-पंक्ति SSH लॉन्च का उपयोग करें:

```bash
ssh root@<clore-server-ip> "docker run --gpus all -d \
  -p 8000:8000 \
  -v /root/.cache:/root/.cache \
  --name nemotron3 \
  vllm/vllm-openai:v0.7.3 \
  --model nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
  --quantization fp4 \
  --max-model-len 32768 && echo 'शुरू किया गया'"
```

### 3. API का परीक्षण करें

```bash
curl http://<server-ip>:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
    "messages": [
      {"role": "system", "content": "आप एक सहायक सहायक हैं."},
      {"role": "user", "content": "GitHub issues को स्क्रैप करने और उन्हें गंभीरता के अनुसार वर्गीकृत करने के लिए एक Python फ़ंक्शन लिखें."}
    ],
    "max_tokens": 2048,
    "temperature": 0.1
  }'
```

## एजेंटिक उपयोग मामला: मल्टी-एजेंट कोडिंग पाइपलाइन

Nemotron 3 Super को मल्टी-एजेंट वर्कफ़्लो के लिए उद्देश्यपूर्ण रूप से बनाया गया है। OpenAI-संगत API का उपयोग करते हुए यहाँ एक न्यूनतम उदाहरण है:

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://<server-ip>:8000/v1",
    api_key="none"
)

def planning_agent(task: str) -> str:
    """उच्च-स्तरीय कार्य विभाजन।"""
    response = client.chat.completions.create(
        model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
        messages=[
            {"role": "system", "content": "आप एक वरिष्ठ इंजीनियरिंग लीड हैं। जटिल कार्यों को स्वीकृति मानदंडों सहित ठोस उप-कार्यों में विभाजित करें।"},
            {"role": "user", "content": f"इस कार्य को विभाजित करें: {task}"}
        ],
        max_tokens=1024,
        temperature=0.0
    )
    return response.choices[0].message.content

def coding_agent(subtask: str) -> str:
    """कोड कार्यान्वयन।"""
    response = client.chat.completions.create(
        model="nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16",
        messages=[
            {"role": "system", "content": "आप एक विशेषज्ञ Python इंजीनियर हैं। परीक्षणों के साथ प्रोडक्शन-गुणवत्ता का कोड लिखें।"},
            {"role": "user", "content": subtask}
        ],
        max_tokens=2048,
        temperature=0.1
    )
    return response.choices[0].message.content

# उदाहरण: स्वायत्त फीचर कार्यान्वयन
plan = planning_agent("JWT के साथ उपयोगकर्ता प्रमाणीकरण के लिए एक REST API बनाएं")
print("योजना:", plan)
code = coding_agent(f"इस योजना से चरण 1 लागू करें: {plan}")
print("कोड:", code)
```

## बेंचमार्क्स (मार्च 2026)

| Benchmark          | Nemotron 3 Super | DeepSeek V3 | Llama 4 Maverick |
| ------------------ | ---------------- | ----------- | ---------------- |
| HumanEval          | 92.1%            | 90.8%       | 88.4%            |
| MATH-500           | 89.3%            | 90.2%       | 84.7%            |
| SWE-bench Verified | 65.2%            | 61.4%       | 55.8%            |
| MMLU               | 88.7%            | 87.2%       | 86.1%            |
| थ्रूपुट (tok/s)    | 1,840            | 410         | 890              |

*थ्रूपुट 2× H100 80GB पर INT4 क्वांटाइज़ेशन के साथ मापा गया।*

## मॉनिटरिंग एवं प्रोडक्शन टिप्स

```bash
# GPU मेमोरी और उपयोग देखें
watch -n2 nvidia-smi

# vLLM थ्रूपुट आँकड़े जाँचें
curl http://localhost:8000/metrics 2>/dev/null | grep vllm

# Docker लॉग्स (लाइव)
docker logs -f nemotron3

# अगर OOM हो: max_model_len कम करें या tensor-parallel-size बढ़ाएँ
```

**Clore.ai पर प्रोडक्शन के लिए अनुशंसित सेटिंग्स:**

* `--max-model-len 32768` अधिकांश वर्कलोड्स के लिए (VRAM बचाता है, 95% अनुरोधों को कवर करता है)
* `--gpu-memory-utilization 0.90` (MoE रूटिंग ओवरहेड के लिए 10% बफर छोड़ें)
* `--enable-chunked-prefill` लंबे इनपुट पर बेहतर लेटेंसी के लिए
* बैच वर्कलोड्स पर 30–40% लागत बचत के लिए spot ऑर्डर सक्षम करें

## लागत तुलना

| प्रदाता                  | कॉन्फ़िगरेशन | $/hr     |
| ------------------------ | ------------ | -------- |
| **Clore.ai** (स्पॉट)     | 2× RTX 5090  | \~$5.60  |
| **Clore.ai** (ऑन-डिमांड) | 2× RTX 5090  | \~$7.00  |
| Azure AI                 | होस्टेड API  | \~$15–20 |
| NVIDIA API               | होस्टेड API  | \~$12–18 |

*सतत वर्कलोड्स के लिए Clore.ai पर सेल्फ-होस्टिंग, प्रबंधित API की तुलना में 2–3× सस्ती है।*

## संबंधित गाइड

* [vLLM सर्विंग](/guides/guides_v2-hi/language-models/vllm.md) — OpenAI-संगत API के साथ प्रोडक्शन LLM सर्वर
* [SGLang](/guides/guides_v2-hi/language-models/sglang.md) — RadixAttention के साथ तेज़ MoE थ्रूपुट
* [DeepSeek V4](/guides/guides_v2-hi/language-models/deepseek-v4.md) — आगामी 1T-पैरामीटर ओपन मॉडल
* [CrewAI](/guides/guides_v2-hi/ai/crewai.md) — भूमिका-आधारित एजेंटों के साथ मल्टी-एजेंट पाइपलाइन बनाएं
* [OpenHands](/guides/guides_v2-hi/ai/openhands.md) — स्वायत्त सॉफ़्टवेयर इंजीनियरिंग एजेंट
* [जीपीयू तुलना](/guides/guides_v2-hi/getting-started/gpu-comparison.md) — अपने वर्कलोड के लिए सही GPU चुनें

***

*अंतिम अद्यतन: 16 मार्च, 2026 | मॉडल जारी: 11 मार्च, 2026 | लाइसेंस: NVIDIA Nemotron Open Model License*


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/language-models/nvidia-nemotron-3-super.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
