> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/language-models/mimo-v25-pro.md).

# MiMo-V2.5-Pro (Xiaomi 1T MoE)

Clore.ai पर Xiaomi द्वारा MiMo-V2.5-Pro (1.02T MoE, 42B active, 1M संदर्भ) डिप्लॉय करें — MiMo टीम का पहला ओपन-वेट Pro tier, FP8 नेटिव, हाइब्रिड अटेंशन

{% hint style="info" %}
**स्थिति (अप्रैल 2026):** MiMo-V2.5-Pro जारी किया गया था **27 अप्रैल, 2026** Xiaomi के AI विभाग द्वारा उनके **Pro** टियर में पहले ओपन-वेट मॉडल के रूप में — पिछला MiMo-V2-Pro केवल API-आधारित था, उसके कोई सार्वजनिक weights नहीं थे। Weights यहाँ उपलब्ध हैं [huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro) के अंतर्गत **MIT लाइसेंस**. मॉडल कार्ड आख़िरी बार 28 अप्रैल, 2026 को अपडेट हुआ था, इसलिए deployment tooling, community quants, और reproductions अभी भी धीरे-धीरे आ रहे हैं।
{% endhint %}

MiMo-V2.5-Pro एक **1.02 ट्रिलियन पैरामीटर वाला Mixture-of-Experts** मॉडल है जो केवल **प्रति टोकन \~42B पैरामीटर**सक्रिय करता है। MiMo टीम — जिसका नेतृत्व पूर्व DeepSeek शोधकर्ता **Luo Fuli** — ने इसे दो विचारों के इर्द-गिर्द डिज़ाइन किया: एक **हाइब्रिड attention scheme** जो 6:1 अनुपात में Sliding Window Attention (SWA) और Global Attention (GA) को मिलाता है (\~128-टोकन विंडो के साथ \~7× KV-cache reduction), और **3 हल्के Multi-Token Prediction (MTP) मॉड्यूल** जो लगभग **3× आउटपुट गति** autogressive workloads पर देते हैं। आर्किटेक्चर में 70 परतें हैं (1 dense + 69 MoE), hidden size 6144 है, और यह मूल रूप से **FP8 E4M3 मिश्रित परिशुद्धता**.

Clore.ai उपयोगकर्ताओं के लिए दो बातें महत्वपूर्ण हैं। पहली, यह **पहला सार्वजनिक weights वाला MiMo Pro रिलीज़ है**: पिछले Pro वेरिएंट केवल hosted API के रूप में और OpenRouter पर stealth-tested "Hunter Alpha" मॉडल के रूप में मौजूद थे (मार्च 2026 की समयरेखा)। दूसरी, **MIT लाइसेंस** व्यावसायिक प्रतिबंधों को पूरी तरह हटाता है — fine-tune करें, redistribute करें, इसे paid endpoint के रूप में चलाएँ, कोई caveat नहीं। Xiaomi की लॉन्च घोषणा का दावा है कि V2.5-Pro **agentic tasks पर DeepSeek V4 को पछाड़ता है**लेकिन वह benchmark केवल vendor-published है — third-party reproduction अभी तक नहीं आई है, और उस caveat के बिना आपको इसे बाहरी रूप से quote नहीं करना चाहिए।

### मुख्य विनिर्देश

| गुण                  | मान                                                               |
| -------------------- | ----------------------------------------------------------------- |
| कुल पैरामीटर         | 1.02T (MoE)                                                       |
| सक्रिय पैरामीटर      | \~42B प्रति forward pass                                          |
| संदर्भ विंडो         | 1,000,000 टोकन (1M)                                               |
| परिशुद्धता           | FP8 E4M3 मिश्रित (मूल)                                            |
| आर्किटेक्चर          | हाइब्रिड SWA + GA (6:1), 70 परतें (1 dense + 69 MoE), hidden 6144 |
| KV-Cache             | स्लाइडिंग विंडो 128, पूर्ण GA की तुलना में \~7× कमी               |
| Speculative Decoding | 3 हल्के MTP मॉड्यूल, \~3× आउटपुट गति                              |
| लाइसेंस              | MIT                                                               |
| रिलीज़ तिथि          | 27 अप्रैल, 2026                                                   |
| संगठन                | Xiaomi MiMo टीम (HuggingFace पर XiaomiMiMo)                       |
| मुख्य टूलिंग         | SGLang (first-class), vLLM                                        |

### MiMo-V2.5-Pro क्यों?

* **पहला खुला Pro-tier MiMo** — पूर्ववर्ती MiMo-V2-Pro केवल API-आधारित था, Pro weights पहली बार सार्वजनिक हैं
* **1M-टोकन संदर्भ** — पूरे codebases, लंबे agent traces, या multi-document RAG को chunking के बिना संभालता है
* **हाइब्रिड attention** — SWA + GA 6:1 पर pure global attention की तुलना में KV-cache को \~7× घटाता है; लंबे संदर्भ संभालने योग्य रहते हैं
* **मूल FP8** — post-hoc quantization नहीं, weights सीधे vendor से FP8 E4M3 में आते हैं
* **MTP speculative decoding** — 3 built-in MTP मॉड्यूल out of the box \~3× decode throughput देते हैं
* **MIT लाइसेंस** — कोई व्यावसायिक प्रतिबंध नहीं, कोई field-of-use सीमा नहीं
* **42B सक्रिय** — 1.02T headline number होने के बावजूद inference लागत 42B-dense जैसी ही चुकानी होगी
* **वंशावली** — प्रमुख शोधकर्ता Luo Fuli पहले DeepSeek में थे, और architectural choices से यह स्पष्ट दिखता है

***

## आवश्यकताएँ

{% hint style="warning" %}
**Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं।** आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता [bare metal](https://clore.ai/bare-metal) के रूप में अनुरोध पर बेची जाती है। देखें [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md) किसी deployment का आकार तय करने से पहले।
{% endhint %}

{% hint style="warning" %}
**फिर भी यह एक 1T मॉडल है।** "42B active" सुनने में आसान लगता है, लेकिन पूरे 1.02T weights को VRAM में रहना होगा (या बहुत आक्रामक offload करना होगा)। मूल FP8 weights को **\~600GB+ VRAM** की आवश्यकता होती है activation memory और KV cache से पहले। पूर्ण-संदर्भ FP8 के लिए 8×H200 या उससे बड़े सेटअप की योजना बनाएँ।
{% endhint %}

| घटक      | न्यूनतम (Quant + offload, भविष्य)                | अनुशंसित (FP8)       | पूर्ण FP8, 1M ctx       |
| -------- | ------------------------------------------------ | -------------------- | ----------------------- |
| GPU VRAM | \~141GB (Q4 + RAM offload, जब quants उपलब्ध हों) | 8× H100 80GB (640GB) | 8× H200 141GB (1,128GB) |
| RAM      | 256GB                                            | 512GB                | 512GB                   |
| डिस्क    | 700GB NVMe                                       | 1.5TB NVMe           | 2TB NVMe                |
| CUDA     | 12.8+                                            | 12.8+                | 12.8+                   |

**हार्डवेयर फिट:** 1M संदर्भ पर पर्याप्त जगह के साथ पूर्ण FP8 के लिए, **8×H200** स्वाभाविक लक्ष्य है — यह एक [bare metal](https://clore.ai/bare-metal) deployment है, marketplace rental नहीं — देखें [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html). 8×H100 80GB भी FP8 checkpoint चलाता है, लेकिन KV cache के लिए जगह छोड़ने हेतु आप `--context-length` को कम (आमतौर पर 256K) तक सीमित करेंगे। Blackwell-class hardware के लिए देखें [clore.ai/rent-b200.html](https://clore.ai/rent-b200.html).

***

## विकल्प A — Ollama / GGUF (Quantized, community builds)

{% hint style="warning" %}
**ध्यान दें:** 28 अप्रैल, 2026 तक (रिलीज़ के एक दिन बाद) **MiMo-V2.5-Pro के community GGUF quants अभी प्रकाशित नहीं हुए हैं**. 1–2 हफ्तों के भीतर Q4\_K\_M / Q5\_K\_M / Q6\_K builds यहाँ आने की उम्मीद है [huggingface.co/models?search=mimo-v2.5-pro+gguf](https://huggingface.co/models?search=mimo-v2.5-pro+gguf). तब तक, SGLang या vLLM के माध्यम से FP8 ही समर्थित रास्ता है।
{% endhint %}

```bash
# जैसे ही Q4_K_M build उपलब्ध हो
docker exec ollama ollama pull mimo-v2.5-pro:q4_K_M
docker exec ollama ollama run mimo-v2.5-pro:q4_K_M

# या सीधे किसी GGUF फ़ाइल पर llama.cpp के साथ (जब प्रकाशित हो)
docker run --gpus all -it --rm -p 8080:8080 \
  -v $(pwd)/models:/models \
  ghcr.io/ggerganov/llama.cpp:server-cuda \
  -m /models/mimo-v2.5-pro-q4_k_m.gguf \
  --n-gpu-layers 99 --ctx-size 65536 \
  --port 8080 --host 0.0.0.0
```

***

## विकल्प B — vLLM (Production API, अनुशंसित)

vLLM MiMo-V2.5-Pro को `--trust-remote-code` के माध्यम से सपोर्ट करता है (hybrid attention + MTP modules repo में custom code के रूप में आते हैं)। vendor के sampling defaults उपयोग करें: **temperature 1.0, top\_p 0.95**.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model XiaomiMiMo/MiMo-V2.5-Pro
      --tensor-parallel-size 8
      --quantization fp8
      --max-model-len 262144
      --gpu-memory-utilization 0.90
      --trust-remote-code
      --served-model-name mimo-v2.5-pro
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# API का परीक्षण करें (vendor-अनुशंसित sampling)
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-pro",
    "messages": [
      {"role": "system", "content": "आप एक स्वायत्त कोडिंग एजेंट हैं।"},
      {"role": "user", "content": "इस 30K-पंक्ति monorepo को चरण-दर-चरण देखें और Express 4 से Fastify 5 में migration plan प्रस्तावित करें।"}
    ],
    "max_tokens": 8192,
    "temperature": 1.0,
    "top_p": 0.95
  }'
```

{% hint style="info" %}
8×H100 80GB पर, `--max-model-len` को 262144 (256K) पर सीमित करें ताकि activations + KV cache के लिए headroom रहे। 8×H200 141GB पर आप आराम से 524288 या उससे अधिक तक जा सकते हैं; 1,048,576 (पूर्ण 1M) संभव है, लेकिन लंबे prefill समय की अपेक्षा करें — उस पर भरोसा करने से पहले परीक्षण करें।
{% endhint %}

***

## विकल्प C — SGLang (अधिकतम throughput के लिए अनुशंसित)

SGLang है **प्रथम-श्रेणी serving target** MiMo-V2.5-Pro model card में। vendor लॉन्च कमांड प्रकाशित करता है **`SGLANG_ENABLE_SPEC_V2=1`** के साथ नए MTP-aware speculative decoding path को सक्रिय करने के लिए, जहाँ वास्तव में \~3× decode speedup मिलता है।

```bash
docker pull lmsysorg/sglang:latest

# HF model card से यथावत
SGLANG_ENABLE_SPEC_V2=1 python3 -m sglang.launch_server \
    --model-path XiaomiMiMo/MiMo-V2.5-Pro \
    --trust-remote-code \
    --quantization fp8 \
    --context-length 1048576 \
    --host 0.0.0.0 --port 9001
```

8×H200 पर multi-GPU TP setup के लिए, जोड़ें `--tp-size 8` और `--mem-fraction-static 0.88`. वास्तविक ट्रैफ़िक भेजने से पहले `nvidia-smi` से पुष्टि करें कि सभी 8 कार्ड populated हैं — यदि किसी rank को संसाधन नहीं मिला, तो 1M संदर्भ बहुत कठोर हो सकता है।

***

## Clore.ai GPU अनुशंसाएँ

| सेटअप         | VRAM    | अपेक्षित प्रदर्शन                                        | Clore.ai लागत                             |
| ------------- | ------- | -------------------------------------------------------- | ----------------------------------------- |
| 4× H100 80GB  | 320GB   | भारी offload के साथ FP8, अधिकतम ctx \~64K, \~10–15 tok/s | \~$4.16/घंटा                              |
| 8× H100 80GB  | 640GB   | पूर्ण FP8, अधिकतम ctx \~256K, \~30–45 tok/s              | \~$8.32/घंटा                              |
| 8× H200 141GB | 1,128GB | पूर्ण FP8, अधिकतम ctx 1M, MTP के साथ \~60+ tok/s         | [bare metal](https://clore.ai/bare-metal) |
| 8× B200       | 1,536GB | पूर्ण FP8, अधिकतम ctx 1M, सबसे तेज़ उपलब्ध               | marketplace pricing                       |

{% hint style="success" %}
**सबसे अच्छी गुणवत्ता:** FP8 checkpoint पर 8× H200 141GB ([bare metal](https://clore.ai/bare-metal)) के साथ `SGLANG_ENABLE_SPEC_V2=1`. आपको पूर्ण 1M संदर्भ विंडो, MTP speculative decoding, और वास्तविक agent loops के लिए पर्याप्त KV-cache headroom मिलता है। देखें [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html) लाइव उपलब्धता के लिए।
{% endhint %}

***

## उपयोग के मामले

* **लंबी-क्षितिज agents** — MiMo टीम स्पष्ट रूप से सतत tool-calling के लिए tuning करती है। 1M संदर्भ और MTP speedup का मतलब है chunking की जटिलताओं के बिना हज़ारों tool turns।
* **पूरे codebase का विश्लेषण** — refactor planning, dependency audits, या migration design के लिए 500K-टोकन monorepo को संदर्भ में डालें
* **लंबे दस्तावेज़ों का RAG** — पूरी किताबें, बहु-वर्षीय customer transcripts, या साल भर का chat history एक ही prompt में फिट हो जाता है
* **कोडिंग** — vendor-claimed HumanEval+ 75.6% और agentic posture इसे autonomous SWE workloads के लिए एक उम्मीदवार बनाते हैं (SWE-agent / OpenHands के साथ जोड़ें)
* **Research scratchpad** — 1M संदर्भ उस तरह के "पूरे पेपर को paste करें, prior work को paste करें, synthesis माँगें" उपयोग को सह लेता है जिसे छोटे मॉडल काट देते हैं

***

## बेंचमार्क

{% hint style="warning" %}
**vendor-claimed — अभी तक कोई third-party reproduction नहीं।** नीचे दिए गए सभी आँकड़े Xiaomi की 27 अप्रैल, 2026 की घोषणा और HuggingFace model card से लिए गए हैं। मॉडल **सिर्फ दो दिन पुराना है** लेखन के समय — agentic और long-context benchmarks पर स्वतंत्र reproductions अभी लंबित हैं। विशेष रूप से "beats DeepSeek V4 on agentic tasks" दावा Xiaomi की अपनी write-up से है; जब तक पुनरुत्पादित न हो, इसे marketing की तरह लें।
{% endhint %}

| Benchmark                            | MiMo-V2.5-Pro (vendor) | नोट्स                                          |
| ------------------------------------ | ---------------------- | ---------------------------------------------- |
| GSM8K                                | **99.6%**              | गणित शब्द समस्याएँ                             |
| HumanEval+                           | 75.6%                  | कोडिंग (विस्तारित)                             |
| MMLU                                 | 89.4%                  | सामान्य ज्ञान                                  |
| GraphWalks (1M ctx) BFS              | 0.37                   | लंबे संदर्भ वाला graph traversal               |
| GraphWalks (1M ctx) Parents          | 0.62                   | लंबे संदर्भ वाला graph traversal               |
| DeepSeek V4 के विरुद्ध agentic tasks | "outperforms" (vendor) | **असत्यापित — third-party reproduction लंबित** |

***

## समस्या निवारण

| समस्या                                   | समाधान                                                                                                                                                           |
| ---------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` लोड पर                | मूल FP8 को फिर भी \~600GB+ VRAM चाहिए। 8× H200 उपयोग करें या `--context-length` को 8× H100 पर 65536 तक घटाएँ।                                                    |
| धीमा HuggingFace डाउनलोड                 | `huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download`. \~600GB FP8 की अपेक्षा करें।                                        |
| `--trust-remote-code` अस्वीकृत           | Hybrid attention और MTP repo में custom code के रूप में आते हैं। यह flag **अनिवार्य** है vLLM और SGLang दोनों के लिए।                                            |
| SGLang में MTP speedup दिखाई नहीं दे रहा | पुष्टि करें `SGLANG_ENABLE_SPEC_V2=1` कि वही shell में export किया गया है जहाँ `python3 -m sglang.launch_server`चल रहा है। default path MTP को सक्रिय नहीं करता। |
| Reasoning trace सपाट / कम गुणवत्ता वाला  | उपयोग करें `temperature=1.0` और `top_p=0.95`. कम तापमान MiMo के reasoning behavior को खराब करते हैं।                                                             |
| 8× H100 पर 1M संदर्भ OOM कर रहा है       | 8× H100 80GB 1M टोकन के लिए KV cache नहीं संभाल सकते। 256K पर सीमित करें या 8× H200 पर जाएँ।                                                                     |
| Prefill में मिनट लगते हैं                | 1M संदर्भ पर अपेक्षित है। उपयोग करें `--enable-chunked-prefill` (vLLM) या इंटरैक्टिव workloads के लिए छोटी requests को batch करें।                               |
| GGUF / Ollama pull विफल                  | 28 अप्रैल, 2026 तक community quants प्रकाशित नहीं हुए हैं। 1–2 हफ्ते प्रतीक्षा करें या सीधे FP8 का उपयोग करें।                                                   |

***

## अगले कदम

* **पूर्ववर्ती / सहोदर:** [MiMo-V2-Flash](/guides/guides_v2-hi/language-models/mimo-v2-flash.md) — 309B MoE, 15B active, 32K ctx, तेज़ लेकिन छोटा
* **vendor का दावा किया गया प्रतिद्वंद्वी:** [DeepSeek V4](/guides/guides_v2-hi/language-models/deepseek-v4.md) — 1M ctx, multimodal, \~1T params (वह मॉडल जिसे Xiaomi का कहना है कि उन्होंने agentic tasks पर पछाड़ा)
* **Open-weight coding प्रतिद्वंद्वी:** [GLM-5.1](/guides/guides_v2-hi/language-models/glm-5-1.md) — 744B MoE, 40B active, MIT, अभी SWE-Bench Pro पर #1
* **H200 क्षमता:** [अनुरोध पर bare metal](https://clore.ai/bare-metal) — 1M संदर्भ पर पूर्ण FP8 1T MoE के लिए सर्वोत्तम फिट
* **Clore.ai marketplace:** [clore.ai/marketplace](https://clore.ai/marketplace)

### लिंक्स

* [HuggingFace पर MiMo-V2.5-Pro](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro)
* [Xiaomi MiMo HuggingFace org](https://huggingface.co/XiaomiMiMo)
* [SGLang repo](https://github.com/sgl-project/sglang)
* [vLLM दस्तावेज़](https://docs.vllm.ai)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/language-models/mimo-v25-pro.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
