> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/language-models/minimax-m3.md).

# MiniMax M3 (428B मल्टीमोडल)

Clore.ai के मल्टी-GPU रिग्स पर MiniMax M3 डिप्लॉय करें, जो 1M-टोकन संदर्भ वाला 428B नेटिव मल्टीमोडल MoE है

{% hint style="info" %}
**स्थिति (अगस्त 2026):** MiniMax ने जारी किया **M3** को **1 जून 2026**, 7 जून तक Hugging Face पर वज़न सहित: [MiniMaxAI/MiniMax-M3](https://huggingface.co/MiniMaxAI/MiniMax-M3). **कुल 428B / \~23B सक्रिय**, **1M-टोकन संदर्भ**, मूल **पाठ + छवि + वीडियो** इनपुट, एक कस्टम के तहत **`minimax-community`** लाइसेंस (Apache या MIT नहीं — इसे व्यावसायिक रूप से जारी करने से पहले पढ़ लें).
{% endhint %}

M3 की दिलचस्प विशेषता इसका आकार नहीं, बल्कि इसका अटेंशन है। **MiniMax Sparse Attention (MSA)** 1M संदर्भ पर प्रति-टोकन गणना को लगभग **1/20** ग्रुप्ड-क्वेरी अटेंशन का, जिससे MiniMax को दावा किया गया **9× तेज प्रीफिल और 15× तेज डिकोड** M2 की तुलना में पूर्ण संदर्भ पर। लंबे दस्तावेज़ और लंबे वीडियो के काम के लिए, यही वह अंतर है जो तय करता है कि आप विंडो भरने का खर्च उठा सकते हैं या नहीं।

प्रति टोकन केवल \~23B पैरामीटर सक्रिय होने के कारण, क्वांटाइज़्ड बिल्ड पर डिकोड गति 428B मॉडल की तुलना में मध्यम-आकार के मॉडल के अधिक करीब है।

### मुख्य विनिर्देश

| गुण          | मान                                                         |
| ------------ | ----------------------------------------------------------- |
| पैरामीटर     | कुल 428B, \~23B सक्रिय (MoE)                                |
| आर्किटेक्चर  | 60 परतें, GQA + MiniMax Sparse Attention, मूल विज़न एन्कोडर |
| मोडैलिटी     | पाठ, छवि, वीडियो इन → पाठ आउट                               |
| संदर्भ       | 1,000,000 टोकन                                              |
| लाइसेंस      | `minimax-community` (कस्टम, व्यावसायिक रूप से प्रतिबंधित)   |
| रिलीज़ तिथि  | 1 जून 2026                                                  |
| वज़न         | BF16 854GB · Q2\_K\_XL GGUF 143GB · Q3\_K\_M GGUF 195GB     |
| मुख्य टूलिंग | vLLM, SGLang, llama.cpp, Transformers                       |

***

## आवश्यकताएँ

| बिल्ड          | आकार    | Clore.ai रिग                                                     |
| -------------- | ------- | ---------------------------------------------------------------- |
| `UD-IQ1_M`     | 128GB   | 6× RTX 5090 (186GB) — आरामदायक                                   |
| `UD-Q2_K_XL`   | 143GB   | 6× RTX 5090 या 8× RTX 4090 (192GB)                               |
| `UD-Q3_K_M`    | 195GB   | 8× RTX 5090 (248GB)                                              |
| `UD-Q4_K_S`    | 248GB   | 10× RTX 5090 (310GB) या 4× RTX PRO 6000 (380GB)                  |
| आधिकारिक MXFP8 | \~430GB | मार्केटप्लेस पर नहीं → [bare metal](https://clore.ai/bare-metal) |
| आधिकारिक BF16  | 854GB   | [bare metal](https://clore.ai/bare-metal)                        |

पिछले स्नैपशॉट में थे **72 सर्वर जिनमें ≥167GB VRAM थी (26 खाली)** और **≥192GB पर 54 (14 खाली)** — Q2 या Q3 बिल्ड रखने के लिए पर्याप्त, लेकिन इतने नहीं कि आप मान लें कि एक हमेशा उपलब्ध ही होगा।

{% hint style="warning" %}
मल्टीमोडल इनपुट के लिए भाषा मॉडल के साथ विज़न टावर लोड होना चाहिए। यदि आप इसमें छवियाँ या वीडियो डालने की योजना बना रहे हैं, तो क्वांट साइज़ से कुछ अतिरिक्त GB का बजट रखें, और वीडियो डिकोडिंग के लिए पर्याप्त सिस्टम RAM वाले रिग को प्राथमिकता दें।
{% endhint %}

***

## llama.cpp के साथ डिप्लॉय करें

```bash
huggingface-cli download unsloth/MiniMax-M3-GGUF \
  --include "*UD-Q2_K_XL*" --local-dir /workspace/m3

llama-server -m /workspace/m3/*UD-Q2_K_XL*-00001-of-*.gguf \
  --host 0.0.0.0 --port 8080 \
  -ngl 999 --split-mode layer \
  -c 262144 --flash-attn --no-mmap
```

## vLLM के साथ डिप्लॉय करें

```bash
vllm serve MiniMaxAI/MiniMax-M3 \
  --tensor-parallel-size 8 \\
  --trust-remote-code \
  --max-model-len 262144 \
  --gpu-memory-utilization 0.92 \
  --enable-expert-parallel
```

पूर्व-परिमाणित चेकपॉइंट्स: [`MiniMaxAI/MiniMax-M3-MXFP8`](https://huggingface.co/MiniMaxAI/MiniMax-M3-MXFP8) (आधिकारिक), [`nvidia/MiniMax-M3-NVFP4`](https://huggingface.co/nvidia/MiniMax-M3-NVFP4) Blackwell के लिए, [`cyankiwi/MiniMax-M3-AWQ-INT4`](https://huggingface.co/cyankiwi/MiniMax-M3-AWQ-INT4) AWQ स्टैक्स के लिए।

***

## Clore.ai GPU अनुशंसाएँ

| सेटअप           | कुल VRAM  | बिल्ड        | Clore.ai लागत       |
| --------------- | --------- | ------------ | ------------------- |
| 6× RTX 5090     | 186GB     | Q2\_K\_XL    | \~$1.50–2.60/घंटा   |
| 8× RTX 4090     | 192GB     | Q2\_K\_XL    | \~$1.12–3.36/घंटा   |
| **8× RTX 5090** | **248GB** | **Q3\_K\_M** | **\~$2.00–3.50/hr** |
| 4× RTX PRO 6000 | 380GB     | Q4\_K\_S     | \~$5.00/घंटा        |

***

## उपयोग के मामले

* **लंबे वीडियो की समझ** — मूल वीडियो इनपुट plus स्पार्स-अटेंशन लागत वक्र
* **मिलियन-टोकन दस्तावेज़ विश्लेषण** — अनुबंध, कोडबेस, अभिलेखागार एक ही पास में
* **एजेंटिक कोडिंग और "cowork" कार्य** — जिसके लिए MiniMax ने M3 को अनुकूलित किया
* **फ्रंटियर-स्तर पर सस्ता डिकोड** — 23B सक्रिय पैरामीटर का मतलब है कि मॉडल के आकार की तुलना में टोकन तेज़ी से निकलते हैं
* **मल्टीमोडल RAG** — पाठ, स्क्रीनशॉट और वीडियो फ़्रेम के लिए एक मॉडल

{% hint style="warning" %}
**व्यावसायिक उपयोग से पहले लाइसेंस जाँच लें।** M3 के तहत जारी होता है `minimax-community`, कोई OSI लाइसेंस नहीं। यदि आपको बिना-प्रतिबंध शर्तें चाहिए, [GLM-5.2](/guides/guides_v2-hi/language-models/glm-5-2.md) MIT है और [Qwen3.8-27B](/guides/guides_v2-hi/language-models/qwen38-27b.md) Apache 2.0 है.
{% endhint %}

***

## समस्या निवारण

| समस्या                         | ठीक करें                                                                                           |
| ------------------------------ | -------------------------------------------------------------------------------------------------- |
| `trust_remote_code` त्रुटियाँ  | M3 कस्टम मॉडलिंग कोड के साथ आता है — पास करें `--trust-remote-code` vLLM में                       |
| स्पार्स अटेंशन कर्नेल गायब हैं | vLLM/SGLang अपडेट करें; जून रिलीज़ के बाद MSA समर्थन आया                                           |
| वीडियो इनपुट विफल होता है      | जाँचें कि रिग में डिकोडिंग के लिए पर्याप्त सिस्टम RAM और CPU है; वीडियो host-side पर डिकोड होता है |
| 1M संदर्भ पर OOM               | KV कैश GQA से छोटा है, लेकिन मुफ़्त नहीं — 262K से शुरू करें और आगे बढ़ें                          |
| धीमा प्रीफिल                   | चंक्ड प्रीफिल सक्षम करें; MSA का लाभ लंबे संदर्भ पर दिखता है, छोटे प्रॉम्प्ट्स पर नहीं             |

***

## अगले चरण

* **पूर्ववर्ती:** [MiniMax M2.7](/guides/guides_v2-hi/language-models/minimax-m27.md) — अप्रैल का कोडिंग MoE
* **समान पैमाने पर MIT विकल्प:** [GLM-5.2](/guides/guides_v2-hi/language-models/glm-5-2.md)
* **एकल-कार्ड विकल्प:** [Qwen3.8-27B](/guides/guides_v2-hi/language-models/qwen38-27b.md)
* **रिग आकार निर्धारण:** [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md)

### लिंक्स

* [Hugging Face पर MiniMax M3](https://huggingface.co/MiniMaxAI/MiniMax-M3) · [GGUF](https://huggingface.co/unsloth/MiniMax-M3-GGUF)
* [तकनीकी रिपोर्ट (arXiv 2606.13392)](https://arxiv.org/abs/2606.13392) · [MSA रिपो](https://github.com/MiniMax-AI/MSA)
* [MiniMax-M3 GitHub](https://github.com/MiniMax-AI/MiniMax-M3)
* **GPU किराये पर लें:** [RTX 5090](https://clore.ai/rent-5090.html) · [RTX 4090](https://clore.ai/rent-4090.html) · [मार्केटप्लेस](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/language-models/minimax-m3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
