For the complete documentation index, see llms.txt. This page is also available as Markdown.

MiMo-V2.5-Pro (Xiaomi 1T MoE)

Clore.ai पर Xiaomi द्वारा MiMo-V2.5-Pro (1.02T MoE, 42B active, 1M संदर्भ) डिप्लॉय करें — MiMo टीम का पहला ओपन-वेट Pro tier, FP8 नेटिव, हाइब्रिड अटेंशन

स्थिति (अप्रैल 2026): MiMo-V2.5-Pro जारी किया गया था 27 अप्रैल, 2026 Xiaomi के AI विभाग द्वारा उनके Pro टियर में पहले ओपन-वेट मॉडल के रूप में — पिछला MiMo-V2-Pro केवल API-आधारित था, उसके कोई सार्वजनिक weights नहीं थे। Weights यहाँ उपलब्ध हैं huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro के अंतर्गत MIT लाइसेंस. मॉडल कार्ड आख़िरी बार 28 अप्रैल, 2026 को अपडेट हुआ था, इसलिए deployment tooling, community quants, और reproductions अभी भी धीरे-धीरे आ रहे हैं।

MiMo-V2.5-Pro एक 1.02 ट्रिलियन पैरामीटर वाला Mixture-of-Experts मॉडल है जो केवल प्रति टोकन ~42B पैरामीटरसक्रिय करता है। MiMo टीम — जिसका नेतृत्व पूर्व DeepSeek शोधकर्ता Luo Fuli — ने इसे दो विचारों के इर्द-गिर्द डिज़ाइन किया: एक हाइब्रिड attention scheme जो 6:1 अनुपात में Sliding Window Attention (SWA) और Global Attention (GA) को मिलाता है (~128-टोकन विंडो के साथ ~7× KV-cache reduction), और 3 हल्के Multi-Token Prediction (MTP) मॉड्यूल जो लगभग 3× आउटपुट गति autogressive workloads पर देते हैं। आर्किटेक्चर में 70 परतें हैं (1 dense + 69 MoE), hidden size 6144 है, और यह मूल रूप से FP8 E4M3 मिश्रित परिशुद्धता.

Clore.ai उपयोगकर्ताओं के लिए दो बातें महत्वपूर्ण हैं। पहली, यह पहला सार्वजनिक weights वाला MiMo Pro रिलीज़ है: पिछले Pro वेरिएंट केवल hosted API के रूप में और OpenRouter पर stealth-tested "Hunter Alpha" मॉडल के रूप में मौजूद थे (मार्च 2026 की समयरेखा)। दूसरी, MIT लाइसेंस व्यावसायिक प्रतिबंधों को पूरी तरह हटाता है — fine-tune करें, redistribute करें, इसे paid endpoint के रूप में चलाएँ, कोई caveat नहीं। Xiaomi की लॉन्च घोषणा का दावा है कि V2.5-Pro agentic tasks पर DeepSeek V4 को पछाड़ता हैलेकिन वह benchmark केवल vendor-published है — third-party reproduction अभी तक नहीं आई है, और उस caveat के बिना आपको इसे बाहरी रूप से quote नहीं करना चाहिए।

मुख्य विनिर्देश

गुण
मान

कुल पैरामीटर

1.02T (MoE)

सक्रिय पैरामीटर

~42B प्रति forward pass

संदर्भ विंडो

1,000,000 टोकन (1M)

परिशुद्धता

FP8 E4M3 मिश्रित (मूल)

आर्किटेक्चर

हाइब्रिड SWA + GA (6:1), 70 परतें (1 dense + 69 MoE), hidden 6144

KV-Cache

स्लाइडिंग विंडो 128, पूर्ण GA की तुलना में ~7× कमी

Speculative Decoding

3 हल्के MTP मॉड्यूल, ~3× आउटपुट गति

लाइसेंस

MIT

रिलीज़ तिथि

27 अप्रैल, 2026

संगठन

Xiaomi MiMo टीम (HuggingFace पर XiaomiMiMo)

मुख्य टूलिंग

SGLang (first-class), vLLM

MiMo-V2.5-Pro क्यों?

  • पहला खुला Pro-tier MiMo — पूर्ववर्ती MiMo-V2-Pro केवल API-आधारित था, Pro weights पहली बार सार्वजनिक हैं

  • 1M-टोकन संदर्भ — पूरे codebases, लंबे agent traces, या multi-document RAG को chunking के बिना संभालता है

  • हाइब्रिड attention — SWA + GA 6:1 पर pure global attention की तुलना में KV-cache को ~7× घटाता है; लंबे संदर्भ संभालने योग्य रहते हैं

  • मूल FP8 — post-hoc quantization नहीं, weights सीधे vendor से FP8 E4M3 में आते हैं

  • MTP speculative decoding — 3 built-in MTP मॉड्यूल out of the box ~3× decode throughput देते हैं

  • MIT लाइसेंस — कोई व्यावसायिक प्रतिबंध नहीं, कोई field-of-use सीमा नहीं

  • 42B सक्रिय — 1.02T headline number होने के बावजूद inference लागत 42B-dense जैसी ही चुकानी होगी

  • वंशावली — प्रमुख शोधकर्ता Luo Fuli पहले DeepSeek में थे, और architectural choices से यह स्पष्ट दिखता है


आवश्यकताएँ

घटक
न्यूनतम (Quant + offload, भविष्य)
अनुशंसित (FP8)
पूर्ण FP8, 1M ctx

GPU VRAM

~141GB (Q4 + RAM offload, जब quants उपलब्ध हों)

8× H100 80GB (640GB)

8× H200 141GB (1,128GB)

RAM

256GB

512GB

512GB

डिस्क

700GB NVMe

1.5TB NVMe

2TB NVMe

CUDA

12.8+

12.8+

12.8+

हार्डवेयर फिट: 1M संदर्भ पर पर्याप्त जगह के साथ पूर्ण FP8 के लिए, 8×H200 स्वाभाविक लक्ष्य है — यह एक bare metal deployment है, marketplace rental नहीं — देखें clore.ai/rent-h200.html. 8×H100 80GB भी FP8 checkpoint चलाता है, लेकिन KV cache के लिए जगह छोड़ने हेतु आप --context-length को कम (आमतौर पर 256K) तक सीमित करेंगे। Blackwell-class hardware के लिए देखें clore.ai/rent-b200.html.


विकल्प A — Ollama / GGUF (Quantized, community builds)


विकल्प B — vLLM (Production API, अनुशंसित)

vLLM MiMo-V2.5-Pro को --trust-remote-code के माध्यम से सपोर्ट करता है (hybrid attention + MTP modules repo में custom code के रूप में आते हैं)। vendor के sampling defaults उपयोग करें: temperature 1.0, top_p 0.95.

8×H100 80GB पर, --max-model-len को 262144 (256K) पर सीमित करें ताकि activations + KV cache के लिए headroom रहे। 8×H200 141GB पर आप आराम से 524288 या उससे अधिक तक जा सकते हैं; 1,048,576 (पूर्ण 1M) संभव है, लेकिन लंबे prefill समय की अपेक्षा करें — उस पर भरोसा करने से पहले परीक्षण करें।


विकल्प C — SGLang (अधिकतम throughput के लिए अनुशंसित)

SGLang है प्रथम-श्रेणी serving target MiMo-V2.5-Pro model card में। vendor लॉन्च कमांड प्रकाशित करता है SGLANG_ENABLE_SPEC_V2=1 के साथ नए MTP-aware speculative decoding path को सक्रिय करने के लिए, जहाँ वास्तव में ~3× decode speedup मिलता है।

8×H200 पर multi-GPU TP setup के लिए, जोड़ें --tp-size 8 और --mem-fraction-static 0.88. वास्तविक ट्रैफ़िक भेजने से पहले nvidia-smi से पुष्टि करें कि सभी 8 कार्ड populated हैं — यदि किसी rank को संसाधन नहीं मिला, तो 1M संदर्भ बहुत कठोर हो सकता है।


Clore.ai GPU अनुशंसाएँ

सेटअप
VRAM
अपेक्षित प्रदर्शन
Clore.ai लागत

4× H100 80GB

320GB

भारी offload के साथ FP8, अधिकतम ctx ~64K, ~10–15 tok/s

~$4.16/घंटा

8× H100 80GB

640GB

पूर्ण FP8, अधिकतम ctx ~256K, ~30–45 tok/s

~$8.32/घंटा

8× H200 141GB

1,128GB

पूर्ण FP8, अधिकतम ctx 1M, MTP के साथ ~60+ tok/s

8× B200

1,536GB

पूर्ण FP8, अधिकतम ctx 1M, सबसे तेज़ उपलब्ध

marketplace pricing


उपयोग के मामले

  • लंबी-क्षितिज agents — MiMo टीम स्पष्ट रूप से सतत tool-calling के लिए tuning करती है। 1M संदर्भ और MTP speedup का मतलब है chunking की जटिलताओं के बिना हज़ारों tool turns।

  • पूरे codebase का विश्लेषण — refactor planning, dependency audits, या migration design के लिए 500K-टोकन monorepo को संदर्भ में डालें

  • लंबे दस्तावेज़ों का RAG — पूरी किताबें, बहु-वर्षीय customer transcripts, या साल भर का chat history एक ही prompt में फिट हो जाता है

  • कोडिंग — vendor-claimed HumanEval+ 75.6% और agentic posture इसे autonomous SWE workloads के लिए एक उम्मीदवार बनाते हैं (SWE-agent / OpenHands के साथ जोड़ें)

  • Research scratchpad — 1M संदर्भ उस तरह के "पूरे पेपर को paste करें, prior work को paste करें, synthesis माँगें" उपयोग को सह लेता है जिसे छोटे मॉडल काट देते हैं


बेंचमार्क

Benchmark
MiMo-V2.5-Pro (vendor)
नोट्स

GSM8K

99.6%

गणित शब्द समस्याएँ

HumanEval+

75.6%

कोडिंग (विस्तारित)

MMLU

89.4%

सामान्य ज्ञान

GraphWalks (1M ctx) BFS

0.37

लंबे संदर्भ वाला graph traversal

GraphWalks (1M ctx) Parents

0.62

लंबे संदर्भ वाला graph traversal

DeepSeek V4 के विरुद्ध agentic tasks

"outperforms" (vendor)

असत्यापित — third-party reproduction लंबित


समस्या निवारण

समस्या
समाधान

OutOfMemoryError लोड पर

मूल FP8 को फिर भी ~600GB+ VRAM चाहिए। 8× H200 उपयोग करें या --context-length को 8× H100 पर 65536 तक घटाएँ।

धीमा HuggingFace डाउनलोड

huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download. ~600GB FP8 की अपेक्षा करें।

--trust-remote-code अस्वीकृत

Hybrid attention और MTP repo में custom code के रूप में आते हैं। यह flag अनिवार्य है vLLM और SGLang दोनों के लिए।

SGLang में MTP speedup दिखाई नहीं दे रहा

पुष्टि करें SGLANG_ENABLE_SPEC_V2=1 कि वही shell में export किया गया है जहाँ python3 -m sglang.launch_serverचल रहा है। default path MTP को सक्रिय नहीं करता।

Reasoning trace सपाट / कम गुणवत्ता वाला

उपयोग करें temperature=1.0 और top_p=0.95. कम तापमान MiMo के reasoning behavior को खराब करते हैं।

8× H100 पर 1M संदर्भ OOM कर रहा है

8× H100 80GB 1M टोकन के लिए KV cache नहीं संभाल सकते। 256K पर सीमित करें या 8× H200 पर जाएँ।

Prefill में मिनट लगते हैं

1M संदर्भ पर अपेक्षित है। उपयोग करें --enable-chunked-prefill (vLLM) या इंटरैक्टिव workloads के लिए छोटी requests को batch करें।

GGUF / Ollama pull विफल

28 अप्रैल, 2026 तक community quants प्रकाशित नहीं हुए हैं। 1–2 हफ्ते प्रतीक्षा करें या सीधे FP8 का उपयोग करें।


अगले कदम

  • पूर्ववर्ती / सहोदर: MiMo-V2-Flash — 309B MoE, 15B active, 32K ctx, तेज़ लेकिन छोटा

  • vendor का दावा किया गया प्रतिद्वंद्वी: DeepSeek V4 — 1M ctx, multimodal, ~1T params (वह मॉडल जिसे Xiaomi का कहना है कि उन्होंने agentic tasks पर पछाड़ा)

  • Open-weight coding प्रतिद्वंद्वी: GLM-5.1 — 744B MoE, 40B active, MIT, अभी SWE-Bench Pro पर #1

  • H200 क्षमता: अनुरोध पर bare metal — 1M संदर्भ पर पूर्ण FP8 1T MoE के लिए सर्वोत्तम फिट

  • Clore.ai marketplace: clore.ai/marketplace

लिंक्स

अंतिम अपडेट

क्या यह उपयोगी था?