MiMo-V2.5-Pro (Xiaomi 1T MoE)
Clore.ai पर Xiaomi द्वारा MiMo-V2.5-Pro (1.02T MoE, 42B active, 1M संदर्भ) डिप्लॉय करें — MiMo टीम का पहला ओपन-वेट Pro tier, FP8 नेटिव, हाइब्रिड अटेंशन
MiMo-V2.5-Pro एक 1.02 ट्रिलियन पैरामीटर वाला Mixture-of-Experts मॉडल है जो केवल प्रति टोकन ~42B पैरामीटरसक्रिय करता है। MiMo टीम — जिसका नेतृत्व पूर्व DeepSeek शोधकर्ता Luo Fuli — ने इसे दो विचारों के इर्द-गिर्द डिज़ाइन किया: एक हाइब्रिड attention scheme जो 6:1 अनुपात में Sliding Window Attention (SWA) और Global Attention (GA) को मिलाता है (~128-टोकन विंडो के साथ ~7× KV-cache reduction), और 3 हल्के Multi-Token Prediction (MTP) मॉड्यूल जो लगभग 3× आउटपुट गति autogressive workloads पर देते हैं। आर्किटेक्चर में 70 परतें हैं (1 dense + 69 MoE), hidden size 6144 है, और यह मूल रूप से FP8 E4M3 मिश्रित परिशुद्धता.
Clore.ai उपयोगकर्ताओं के लिए दो बातें महत्वपूर्ण हैं। पहली, यह पहला सार्वजनिक weights वाला MiMo Pro रिलीज़ है: पिछले Pro वेरिएंट केवल hosted API के रूप में और OpenRouter पर stealth-tested "Hunter Alpha" मॉडल के रूप में मौजूद थे (मार्च 2026 की समयरेखा)। दूसरी, MIT लाइसेंस व्यावसायिक प्रतिबंधों को पूरी तरह हटाता है — fine-tune करें, redistribute करें, इसे paid endpoint के रूप में चलाएँ, कोई caveat नहीं। Xiaomi की लॉन्च घोषणा का दावा है कि V2.5-Pro agentic tasks पर DeepSeek V4 को पछाड़ता हैलेकिन वह benchmark केवल vendor-published है — third-party reproduction अभी तक नहीं आई है, और उस caveat के बिना आपको इसे बाहरी रूप से quote नहीं करना चाहिए।
मुख्य विनिर्देश
कुल पैरामीटर
1.02T (MoE)
सक्रिय पैरामीटर
~42B प्रति forward pass
संदर्भ विंडो
1,000,000 टोकन (1M)
परिशुद्धता
FP8 E4M3 मिश्रित (मूल)
आर्किटेक्चर
हाइब्रिड SWA + GA (6:1), 70 परतें (1 dense + 69 MoE), hidden 6144
KV-Cache
स्लाइडिंग विंडो 128, पूर्ण GA की तुलना में ~7× कमी
Speculative Decoding
3 हल्के MTP मॉड्यूल, ~3× आउटपुट गति
लाइसेंस
MIT
रिलीज़ तिथि
27 अप्रैल, 2026
संगठन
Xiaomi MiMo टीम (HuggingFace पर XiaomiMiMo)
मुख्य टूलिंग
SGLang (first-class), vLLM
MiMo-V2.5-Pro क्यों?
पहला खुला Pro-tier MiMo — पूर्ववर्ती MiMo-V2-Pro केवल API-आधारित था, Pro weights पहली बार सार्वजनिक हैं
1M-टोकन संदर्भ — पूरे codebases, लंबे agent traces, या multi-document RAG को chunking के बिना संभालता है
हाइब्रिड attention — SWA + GA 6:1 पर pure global attention की तुलना में KV-cache को ~7× घटाता है; लंबे संदर्भ संभालने योग्य रहते हैं
मूल FP8 — post-hoc quantization नहीं, weights सीधे vendor से FP8 E4M3 में आते हैं
MTP speculative decoding — 3 built-in MTP मॉड्यूल out of the box ~3× decode throughput देते हैं
MIT लाइसेंस — कोई व्यावसायिक प्रतिबंध नहीं, कोई field-of-use सीमा नहीं
42B सक्रिय — 1.02T headline number होने के बावजूद inference लागत 42B-dense जैसी ही चुकानी होगी
वंशावली — प्रमुख शोधकर्ता Luo Fuli पहले DeepSeek में थे, और architectural choices से यह स्पष्ट दिखता है
आवश्यकताएँ
Clore.ai marketplace पर multi-GPU 80GB-class rigs सूचीबद्ध नहीं हैं। आज सूचीबद्ध सबसे बड़े boxes 4× RTX PRO 6000 Blackwell (प्रत्येक 96GB, कुल 380GB) और 8–11× RTX 5090 (प्रत्येक 32GB) हैं। A100 / H200 / B200 क्षमता bare metal के रूप में अनुरोध पर बेची जाती है। देखें GPU मूल्य और उपलब्धता किसी deployment का आकार तय करने से पहले।
फिर भी यह एक 1T मॉडल है। "42B active" सुनने में आसान लगता है, लेकिन पूरे 1.02T weights को VRAM में रहना होगा (या बहुत आक्रामक offload करना होगा)। मूल FP8 weights को ~600GB+ VRAM की आवश्यकता होती है activation memory और KV cache से पहले। पूर्ण-संदर्भ FP8 के लिए 8×H200 या उससे बड़े सेटअप की योजना बनाएँ।
GPU VRAM
~141GB (Q4 + RAM offload, जब quants उपलब्ध हों)
8× H100 80GB (640GB)
8× H200 141GB (1,128GB)
RAM
256GB
512GB
512GB
डिस्क
700GB NVMe
1.5TB NVMe
2TB NVMe
CUDA
12.8+
12.8+
12.8+
हार्डवेयर फिट: 1M संदर्भ पर पर्याप्त जगह के साथ पूर्ण FP8 के लिए, 8×H200 स्वाभाविक लक्ष्य है — यह एक bare metal deployment है, marketplace rental नहीं — देखें clore.ai/rent-h200.html. 8×H100 80GB भी FP8 checkpoint चलाता है, लेकिन KV cache के लिए जगह छोड़ने हेतु आप --context-length को कम (आमतौर पर 256K) तक सीमित करेंगे। Blackwell-class hardware के लिए देखें clore.ai/rent-b200.html.
विकल्प A — Ollama / GGUF (Quantized, community builds)
ध्यान दें: 28 अप्रैल, 2026 तक (रिलीज़ के एक दिन बाद) MiMo-V2.5-Pro के community GGUF quants अभी प्रकाशित नहीं हुए हैं. 1–2 हफ्तों के भीतर Q4_K_M / Q5_K_M / Q6_K builds यहाँ आने की उम्मीद है huggingface.co/models?search=mimo-v2.5-pro+gguf. तब तक, SGLang या vLLM के माध्यम से FP8 ही समर्थित रास्ता है।
विकल्प B — vLLM (Production API, अनुशंसित)
vLLM MiMo-V2.5-Pro को --trust-remote-code के माध्यम से सपोर्ट करता है (hybrid attention + MTP modules repo में custom code के रूप में आते हैं)। vendor के sampling defaults उपयोग करें: temperature 1.0, top_p 0.95.
विकल्प C — SGLang (अधिकतम throughput के लिए अनुशंसित)
SGLang है प्रथम-श्रेणी serving target MiMo-V2.5-Pro model card में। vendor लॉन्च कमांड प्रकाशित करता है SGLANG_ENABLE_SPEC_V2=1 के साथ नए MTP-aware speculative decoding path को सक्रिय करने के लिए, जहाँ वास्तव में ~3× decode speedup मिलता है।
8×H200 पर multi-GPU TP setup के लिए, जोड़ें --tp-size 8 और --mem-fraction-static 0.88. वास्तविक ट्रैफ़िक भेजने से पहले nvidia-smi से पुष्टि करें कि सभी 8 कार्ड populated हैं — यदि किसी rank को संसाधन नहीं मिला, तो 1M संदर्भ बहुत कठोर हो सकता है।
Clore.ai GPU अनुशंसाएँ
4× H100 80GB
320GB
भारी offload के साथ FP8, अधिकतम ctx ~64K, ~10–15 tok/s
~$4.16/घंटा
8× H100 80GB
640GB
पूर्ण FP8, अधिकतम ctx ~256K, ~30–45 tok/s
~$8.32/घंटा
8× B200
1,536GB
पूर्ण FP8, अधिकतम ctx 1M, सबसे तेज़ उपलब्ध
marketplace pricing
सबसे अच्छी गुणवत्ता: FP8 checkpoint पर 8× H200 141GB (bare metal) के साथ SGLANG_ENABLE_SPEC_V2=1. आपको पूर्ण 1M संदर्भ विंडो, MTP speculative decoding, और वास्तविक agent loops के लिए पर्याप्त KV-cache headroom मिलता है। देखें clore.ai/rent-h200.html लाइव उपलब्धता के लिए।
उपयोग के मामले
लंबी-क्षितिज agents — MiMo टीम स्पष्ट रूप से सतत tool-calling के लिए tuning करती है। 1M संदर्भ और MTP speedup का मतलब है chunking की जटिलताओं के बिना हज़ारों tool turns।
पूरे codebase का विश्लेषण — refactor planning, dependency audits, या migration design के लिए 500K-टोकन monorepo को संदर्भ में डालें
लंबे दस्तावेज़ों का RAG — पूरी किताबें, बहु-वर्षीय customer transcripts, या साल भर का chat history एक ही prompt में फिट हो जाता है
कोडिंग — vendor-claimed HumanEval+ 75.6% और agentic posture इसे autonomous SWE workloads के लिए एक उम्मीदवार बनाते हैं (SWE-agent / OpenHands के साथ जोड़ें)
Research scratchpad — 1M संदर्भ उस तरह के "पूरे पेपर को paste करें, prior work को paste करें, synthesis माँगें" उपयोग को सह लेता है जिसे छोटे मॉडल काट देते हैं
बेंचमार्क
vendor-claimed — अभी तक कोई third-party reproduction नहीं। नीचे दिए गए सभी आँकड़े Xiaomi की 27 अप्रैल, 2026 की घोषणा और HuggingFace model card से लिए गए हैं। मॉडल सिर्फ दो दिन पुराना है लेखन के समय — agentic और long-context benchmarks पर स्वतंत्र reproductions अभी लंबित हैं। विशेष रूप से "beats DeepSeek V4 on agentic tasks" दावा Xiaomi की अपनी write-up से है; जब तक पुनरुत्पादित न हो, इसे marketing की तरह लें।
GSM8K
99.6%
गणित शब्द समस्याएँ
HumanEval+
75.6%
कोडिंग (विस्तारित)
MMLU
89.4%
सामान्य ज्ञान
GraphWalks (1M ctx) BFS
0.37
लंबे संदर्भ वाला graph traversal
GraphWalks (1M ctx) Parents
0.62
लंबे संदर्भ वाला graph traversal
DeepSeek V4 के विरुद्ध agentic tasks
"outperforms" (vendor)
असत्यापित — third-party reproduction लंबित
समस्या निवारण
OutOfMemoryError लोड पर
मूल FP8 को फिर भी ~600GB+ VRAM चाहिए। 8× H200 उपयोग करें या --context-length को 8× H100 पर 65536 तक घटाएँ।
धीमा HuggingFace डाउनलोड
huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download. ~600GB FP8 की अपेक्षा करें।
--trust-remote-code अस्वीकृत
Hybrid attention और MTP repo में custom code के रूप में आते हैं। यह flag अनिवार्य है vLLM और SGLang दोनों के लिए।
SGLang में MTP speedup दिखाई नहीं दे रहा
पुष्टि करें SGLANG_ENABLE_SPEC_V2=1 कि वही shell में export किया गया है जहाँ python3 -m sglang.launch_serverचल रहा है। default path MTP को सक्रिय नहीं करता।
Reasoning trace सपाट / कम गुणवत्ता वाला
उपयोग करें temperature=1.0 और top_p=0.95. कम तापमान MiMo के reasoning behavior को खराब करते हैं।
8× H100 पर 1M संदर्भ OOM कर रहा है
8× H100 80GB 1M टोकन के लिए KV cache नहीं संभाल सकते। 256K पर सीमित करें या 8× H200 पर जाएँ।
Prefill में मिनट लगते हैं
1M संदर्भ पर अपेक्षित है। उपयोग करें --enable-chunked-prefill (vLLM) या इंटरैक्टिव workloads के लिए छोटी requests को batch करें।
GGUF / Ollama pull विफल
28 अप्रैल, 2026 तक community quants प्रकाशित नहीं हुए हैं। 1–2 हफ्ते प्रतीक्षा करें या सीधे FP8 का उपयोग करें।
अगले कदम
पूर्ववर्ती / सहोदर: MiMo-V2-Flash — 309B MoE, 15B active, 32K ctx, तेज़ लेकिन छोटा
vendor का दावा किया गया प्रतिद्वंद्वी: DeepSeek V4 — 1M ctx, multimodal, ~1T params (वह मॉडल जिसे Xiaomi का कहना है कि उन्होंने agentic tasks पर पछाड़ा)
Open-weight coding प्रतिद्वंद्वी: GLM-5.1 — 744B MoE, 40B active, MIT, अभी SWE-Bench Pro पर #1
H200 क्षमता: अनुरोध पर bare metal — 1M संदर्भ पर पूर्ण FP8 1T MoE के लिए सर्वोत्तम फिट
Clore.ai marketplace: clore.ai/marketplace
लिंक्स
अंतिम अपडेट
क्या यह उपयोगी था?