> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/mimo-v25-pro.md).

# MiMo-V2.5-Pro (Xiaomi 1T MoE)

Deploye MiMo-V2.5-Pro (1,02T MoE, 42B aktiv, 1M Kontext) von Xiaomi auf Clore.ai — die erste Open-Weight-Pro-Stufe vom MiMo-Team, FP8-nativ, hybride Attention

{% hint style="info" %}
**Status (April 2026):** MiMo-V2.5-Pro wurde am **27. April 2026** von Xiaomis KI-Abteilung als erstes Open-Weight-Modell in ihrer **Pro** Stufe veröffentlicht — das frühere MiMo-V2-Pro war nur per API verfügbar und hatte keine öffentlichen Gewichte. Die Gewichte sind unter [huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro) unter der **MIT-Lizenz**. Die Model Card wurde zuletzt am 28. April 2026 aktualisiert, daher landen Bereitstellungstools, Community-Quants und Reproduktionen weiterhin Tag für Tag.
{% endhint %}

MiMo-V2.5-Pro ist ein **1,02-Billionen-Parameter-Mixture-of-Experts** -Modell, das nur **\~42B Parameter pro Token**aktiviert. Das MiMo-Team — angeführt von dem ehemaligen DeepSeek-Forscher **Luo Fuli** — entwarf es um zwei Ideen herum: ein **hybrides Attention-Schema** das Sliding Window Attention (SWA) und Global Attention (GA) im Verhältnis 6:1 kombiniert (\~7× weniger KV-Cache mit einem 128-Token-Fenster) sowie **3 leichte Multi-Token-Prediction-(MTP)-Module** die ungefähr **3× Ausgabegeschwindigkeit** bei autoregressiven Workloads liefern. Die Architektur hat 70 Schichten (1 dense + 69 MoE), eine Hidden Size von 6144 und wird nativ in **FP8 E4M3 Mixed Precision**.

Für Clore.ai-Nutzer sind zwei Dinge wichtig. Erstens ist dies die **erste MiMo-Pro-Veröffentlichung mit öffentlichen Gewichten**: Frühere Pro-Varianten existierten nur als gehostete API und als heimlich getestetes "Hunter Alpha"-Modell auf OpenRouter (Zeitachse März 2026). Zweitens **MIT-Lizenz** hebt die kommerziellen Einschränkungen vollständig auf — Fine-Tuning, Weiterverbreitung, Betrieb als kostenpflichtiger Endpunkt, ohne Vorbehalte. Xiaomis Ankündigung zur Markteinführung behauptet, dass V2.5-Pro **DeepSeek V4 bei agentischen Aufgaben übertrifft**, aber dieser Benchmark stammt nur vom Hersteller — eine Reproduktion durch Dritte steht noch aus, und du solltest ihn extern nicht ohne diesen Vorbehalt zitieren.

### Wichtige Spezifikationen

| Eigenschaft            | Wert                                                                      |
| ---------------------- | ------------------------------------------------------------------------- |
| Gesamtparameter        | 1,02T (MoE)                                                               |
| Aktive Parameter       | \~42B pro Forward-Pass                                                    |
| Kontextfenster         | 1.000.000 Token (1M)                                                      |
| Präzision              | FP8 E4M3 Mixed (nativ)                                                    |
| Architektur            | Hybride SWA + GA (6:1), 70 Schichten (1 dense + 69 MoE), Hidden Size 6144 |
| KV-Cache               | Sliding-Window 128, \~7× Reduktion gegenüber vollständiger GA             |
| Spekulatives Decoding  | 3 leichte MTP-Module, \~3× Ausgabegeschwindigkeit                         |
| Lizenz                 | MIT                                                                       |
| Veröffentlichungsdatum | 27. April 2026                                                            |
| Organisation           | Xiaomi-MiMo-Team (XiaomiMiMo auf HuggingFace)                             |
| Primäre Tools          | SGLang (erstklassig), vLLM                                                |

### Warum MiMo-V2.5-Pro?

* **Erstes offenes MiMo der Pro-Stufe** — der Vorgänger MiMo-V2-Pro war nur per API verfügbar, dies ist das erste Mal, dass die Pro-Gewichte öffentlich sind
* **1M-Token-Kontext** — bewältigt ganze Codebasen, lange Agentenspuren oder mehrdokumentiges RAG ohne Chunking
* **Hybride Attention** — SWA + GA im Verhältnis 6:1 reduziert den KV-Cache um \~7× gegenüber reiner globaler Attention; lange Kontexte bleiben beherrschbar
* **Natives FP8** — keine nachträgliche Quantisierung, die Gewichte werden direkt vom Hersteller in FP8 E4M3 ausgeliefert
* **MTP-spekulatives Decoding** — 3 integrierte MTP-Module liefern sofort \~3× Decoding-Durchsatz
* **MIT-Lizenz** — keine kommerziellen Einschränkungen, keine Limits für den Einsatzzweck
* **42B aktiv** — trotz der Schlagzeile von 1,02T zahlst du die Inferenzkosten eines 42B-dichten Modells
* **Abstammung** — die leitende Forscherin Luo Fuli war zuvor bei DeepSeek, und die architektonischen Entscheidungen zeigen

***

## Anforderungen

{% hint style="warning" %}
**Multi-GPU-Rigs der 80-GB-Klasse sind nicht im Clore.ai-Marktplatz gelistet.** Die größten heute gelisteten Systeme sind 4× RTX PRO 6000 Blackwell (je 96GB, insgesamt 380GB) und 8–11× RTX 5090 (je 32GB). A100 / H200 / B200-Kapazität wird als [Bare Metal](https://clore.ai/bare-metal) auf Anfrage verkauft. Prüfe [GPU-Preise und Verfügbarkeit](/guides/guides_v2-de/erste-schritte/pricing.md) bevor du eine Bereitstellung dimensionierst.
{% endhint %}

{% hint style="warning" %}
**Immer noch ein 1T-Modell.** "42B aktiv" klingt freundlich, aber die vollständigen 1,02T-Gewichte müssen im VRAM liegen (oder aggressiv ausgelagert werden). Native FP8-Gewichte benötigen **\~600GB+ VRAM** vor Aktivierungsspeicher und KV-Cache. Plane für 8×H200 oder größer für vollständiges Kontext-FP8.
{% endhint %}

| Komponente | Minimum (Quantisierung + Offload, künftig)             | Empfohlen (FP8)      | Vollständiges FP8, 1M Kontext |
| ---------- | ------------------------------------------------------ | -------------------- | ----------------------------- |
| GPU-VRAM   | \~141GB (Q4 + RAM-Offload, wenn Quants verfügbar sind) | 8× H100 80GB (640GB) | 8× H200 141GB (1,128GB)       |
| RAM        | 256GB                                                  | 512GB                | 512GB                         |
| Festplatte | 700GB NVMe                                             | 1,5TB NVMe           | 2TB NVMe                      |
| CUDA       | 12.8+                                                  | 12.8+                | 12.8+                         |

**Hardware-Passung:** Für vollständiges FP8 mit etwas Puffer für den 1M-Kontext ist **8×H200** die natürliche Zielkonfiguration — das ist eine [Bare Metal](https://clore.ai/bare-metal) Bereitstellung, keine Marktplatzmiete — siehe [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html). 8×H100 80GB kann auch den FP8-Checkpoint ausführen, aber du musst `--context-length` niedriger setzen (typischerweise 256K), um Platz für den KV-Cache zu lassen. Für Hardware der Blackwell-Klasse siehe [clore.ai/rent-b200.html](https://clore.ai/rent-b200.html).

***

## Option A — Ollama / GGUF (quantisiert, Community-Builds)

{% hint style="warning" %}
**Hinweis:** Stand: 28. April 2026 (einen Tag nach der Veröffentlichung) **Community-GGUF-Quants für MiMo-V2.5-Pro sind noch nicht veröffentlicht**. Es ist zu erwarten, dass Q4\_K\_M / Q5\_K\_M / Q6\_K-Builds innerhalb von 1–2 Wochen unter [huggingface.co/models?search=mimo-v2.5-pro+gguf](https://huggingface.co/models?search=mimo-v2.5-pro+gguf)erscheinen. Bis dahin ist FP8 über SGLang oder vLLM der unterstützte Weg.
{% endhint %}

```bash
# Sobald ein Q4_K_M-Build verfügbar ist
docker exec ollama ollama pull mimo-v2.5-pro:q4_K_M
docker exec ollama ollama run mimo-v2.5-pro:q4_K_M

# Oder direkt mit llama.cpp auf einer GGUF-Datei (wenn veröffentlicht)
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/mimo-v2.5-pro-q4_k_m.gguf \\
  --n-gpu-layers 99 --ctx-size 65536 \\
  --port 8080 --host 0.0.0.0
```

***

## Option B — vLLM (Produktions-API, empfohlen)

vLLM unterstützt MiMo-V2.5-Pro über `--trust-remote-code` (die hybriden Attention- und MTP-Module werden als benutzerdefinierter Code im Repo ausgeliefert). Verwende die standardmäßigen Sampling-Einstellungen des Herstellers: **temperature 1.0, top\_p 0.95**.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model XiaomiMiMo/MiMo-V2.5-Pro
      --tensor-parallel-size 8
      --quantization fp8
      --max-model-len 262144
      --gpu-memory-utilization 0.90
      --trust-remote-code
      --served-model-name mimo-v2.5-pro
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Teste die API (vom Hersteller empfohlenes Sampling)
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mimo-v2.5-pro",
    "messages": [
      {"role": "system", "content": "Du bist ein autonomer Coding-Agent."},
      {"role": "user", "content": "Gehe dieses 30K-Zeilen-Monorepo durch und schlage einen Migrationsplan von Express 4 zu Fastify 5 vor."}
    ],
    "max_tokens": 8192,
    "temperature": 1.0,
    "top_p": 0.95
  }'
```

{% hint style="info" %}
Auf 8×H100 80GB begrenze `--max-model-len` auf 262144 (256K), um Spielraum für Aktivierungen + KV-Cache zu lassen. Auf 8×H200 141GB kannst du bequem auf 524288 oder höher gehen; 1.048.576 (vollständige 1M) ist machbar, aber erwarte lange Prefill-Zeiten — teste es, bevor du dich darauf verlässt.
{% endhint %}

***

## Option C — SGLang (für maximalen Durchsatz empfohlen)

SGLang ist das **erstklassige Serving-Ziel** in der MiMo-V2.5-Pro-Model Card. Der Hersteller veröffentlicht den Startbefehl mit **`SGLANG_ENABLE_SPEC_V2=1`** um den neuen MTP-bewussten Pfad für spekulatives Decoding zu aktivieren, und genau dort entsteht die \~3×-Beschleunigung beim Decoding tatsächlich.

```bash
docker pull lmsysorg/sglang:latest

# Wörtlich aus der HF-Model-Card
SGLANG_ENABLE_SPEC_V2=1 python3 -m sglang.launch_server \\
    --model-path XiaomiMiMo/MiMo-V2.5-Pro \\
    --trust-remote-code \\
    --quantization fp8 \\
    --context-length 1048576 \\
    --host 0.0.0.0 --port 9001
```

Für ein Multi-GPU-TP-Setup auf 8×H200 füge `--tp-size 8` und `--mem-fraction-static 0.88`hinzu. Stelle mit `nvidia-smi` sicher, dass alle 8 Karten belegt sind, bevor du echten Traffic sendest — der 1M-Kontext verzeiht es nicht, wenn ein Rank unterversorgt ist.

***

## Clore.ai-GPU-Empfehlungen

| Konfiguration | VRAM    | Erwartete Leistung                                     | Clore.ai-Kosten                           |
| ------------- | ------- | ------------------------------------------------------ | ----------------------------------------- |
| 4× H100 80GB  | 320GB   | FP8 mit starkem Offload, max. ctx \~64K, \~10–15 tok/s | \~$4,16/h                                 |
| 8× H100 80GB  | 640GB   | FP8 voll, max. ctx \~256K, \~30–45 tok/s               | \~$8,32/h                                 |
| 8× H200 141GB | 1,128GB | FP8 voll, max. ctx 1M, \~60+ tok/s mit MTP             | [Bare Metal](https://clore.ai/bare-metal) |
| 8× B200       | 1,536GB | FP8 voll, max. ctx 1M, schnellste verfügbare           | Marktplatzpreis                           |

{% hint style="success" %}
**Beste Qualität:** 8× H200 141GB auf dem FP8-Checkpoint ([Bare Metal](https://clore.ai/bare-metal)) `SGLANG_ENABLE_SPEC_V2=1`Du erhältst das vollständige 1M-Kontextfenster, MTP-spekulatives Decoding und genügend KV-Cache-Puffer für echte Agentenschleifen. Siehe [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html) für die aktuelle Verfügbarkeit.
{% endhint %}

***

## Anwendungsfälle

* **Agenten mit langem Planungshorizont** — das MiMo-Team optimiert ausdrücklich für dauerhaftes Tool-Calling. Der 1M-Kontext plus MTP-Beschleunigung bedeutet tausende Tool-Aufrufe ohne Chunking-Akrobatik.
* **Analyse ganzer Codebasen** — wirf ein 500K-Token-Monorepo in den Kontext für Refaktorierungsplanung, Abhängigkeitsprüfungen oder Migrationsdesign
* **RAG mit langen Dokumenten** — ganze Bücher, mehrjährige Kundentranskripte oder jahrelange Chatverläufe passen in einen einzigen Prompt
* **Programmierung** — die vom Hersteller behaupteten 75,6 % bei HumanEval+ und die agentische Ausrichtung machen es zu einem Kandidaten für autonome SWE-Workloads (kombiniere es mit SWE-agent / OpenHands)
* **Forschungs-Skizzenblock** — 1M Kontext verkraftet die Art von Nutzung, bei der man "das ganze Paper einfügen, die Vorarbeit einfügen und um Synthese bitten" will, die kleinere Modelle abschneiden

***

## Benchmarks

{% hint style="warning" %}
**Vom Hersteller behauptet — noch keine Reproduktion durch Dritte.** Alle Zahlen unten stammen aus Xiaomis Ankündigung vom 27. April 2026 und der HuggingFace-Model-Card. Das Modell ist **zwei Tage alt** zum Zeitpunkt des Schreibens — unabhängige Reproduktionen bei agentischen und Langkontext-Benchmarks stehen noch aus. Insbesondere die Behauptung "übertrifft DeepSeek V4 bei agentischen Aufgaben" stammt aus Xiaomis eigener Veröffentlichung; behandle sie bis zur Reproduktion als Marketing.
{% endhint %}

| Benchmark                           | MiMo-V2.5-Pro (Hersteller) | Hinweise                                                         |
| ----------------------------------- | -------------------------- | ---------------------------------------------------------------- |
| GSM8K                               | **99.6%**                  | Mathe-Textaufgaben                                               |
| HumanEval+                          | 75.6%                      | Programmierung (erweitert)                                       |
| MMLU                                | 89.4%                      | Allgemeinwissen                                                  |
| GraphWalks (1M ctx) BFS             | 0.37                       | Graph-Durchlauf mit langem Kontext                               |
| GraphWalks (1M ctx) Parents         | 0.62                       | Graph-Durchlauf mit langem Kontext                               |
| Agentische Aufgaben vs. DeepSeek V4 | "übertrifft" (Hersteller)  | **Nicht verifiziert — Reproduktion durch Dritte steht noch aus** |

***

## Fehlerbehebung

| Problem                                      | Lösung                                                                                                                                                      |
| -------------------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` beim Laden                | Natives FP8 benötigt weiterhin \~600GB+ VRAM. Verwende 8× H200 oder reduziere `--context-length` auf 65536 auf 8× H100.                                     |
| Langsamer HuggingFace-Download               | `huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download`. Erwarte \~600GB FP8.                                           |
| `--trust-remote-code` abgelehnt              | Hybride Attention und MTP werden als benutzerdefinierter Code im Repo ausgeliefert. Das Flag ist **zwingend erforderlich** für sowohl vLLM als auch SGLang. |
| MTP-Beschleunigung erscheint nicht in SGLang | Stelle sicher `SGLANG_ENABLE_SPEC_V2=1` im selben Shell-Kontext exportiert ist wie `python3 -m sglang.launch_server`. Der Standardpfad aktiviert MTP nicht. |
| Denkspur flach / geringe Qualität            | Verwende `temperature=1.0` und `top_p=0.95`. Niedrigere Temperaturen verschlechtern MiMos Denkverhalten.                                                    |
| 1M-Kontext verursacht OOMs auf 8× H100       | 8× H100 80GB kann den KV-Cache für 1M Token nicht halten. Begrenze auf 256K oder wechsle zu 8× H200.                                                        |
| Prefill dauert Minuten                       | Bei 1M Kontext erwartet. Verwende `--enable-chunked-prefill` (vLLM) oder bündele kürzere Anfragen für interaktive Workloads.                                |
| GGUF-/Ollama-Pull schlägt fehl               | Community-Quants sind zum 28. April 2026 noch nicht veröffentlicht. Warte 1–2 Wochen oder verwende direkt FP8.                                              |

***

## Nächste Schritte

* **Vorgänger / Geschwistermodell:** [MiMo-V2-Flash](/guides/guides_v2-de/sprachmodelle/mimo-v2-flash.md) — 309B MoE, 15B aktiv, 32K ctx, schneller, aber kleiner
* **Vom Hersteller genannter Rivale:** [DeepSeek V4](/guides/guides_v2-de/sprachmodelle/deepseek-v4.md) — 1M ctx, multimodal, \~1T Parameter (das Modell, das Xiaomi zufolge bei agentischen Aufgaben übertroffen wurde)
* **Offener Coding-Rivale:** [GLM-5.1](/guides/guides_v2-de/sprachmodelle/glm-5-1.md) — 744B MoE, 40B aktiv, MIT, derzeit #1 auf SWE-Bench Pro
* **H200-Kapazität:** [Bare Metal auf Anfrage](https://clore.ai/bare-metal) — beste Passung für vollständiges FP8 1T MoE bei 1M Kontext
* **Clore.ai-Marktplatz:** [clore.ai/marketplace](https://clore.ai/marketplace)

### Links

* [MiMo-V2.5-Pro auf HuggingFace](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro)
* [Xiaomi MiMo HuggingFace-Organisation](https://huggingface.co/XiaomiMiMo)
* [SGLang-Repo](https://github.com/sgl-project/sglang)
* [vLLM-Dokumentation](https://docs.vllm.ai)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/mimo-v25-pro.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
