> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mimo-v25-pro.md).

# MiMo-V2.5-Pro (MoE 1T de Xiaomi)

Déployez MiMo-V2.5-Pro (MoE 1,02T, 42B actifs, contexte 1M) de Xiaomi sur Clore.ai — le premier niveau Pro à poids ouverts de l'équipe MiMo, natif FP8, attention hybride

{% hint style="info" %}
**Statut (avril 2026) :** MiMo-V2.5-Pro est sorti le **27 avril 2026** par la division IA de Xiaomi comme le premier modèle à poids ouverts de leur **niveau Pro** — le précédent MiMo-V2-Pro n’était disponible qu’en API, sans poids publics. Les poids sont disponibles sur [huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro) sous la **licence MIT**. La fiche du modèle a été mise à jour pour la dernière fois le 28 avril 2026, donc les outils de déploiement, les quants communautaires et les reproductions arrivent encore au jour le jour.
{% endhint %}

MiMo-V2.5-Pro est un **modèle Mixture-of-Experts de 1,02 billion de paramètres** qui n’active que **≈42B de paramètres par token**. L’équipe MiMo — dirigée par l’ancienne chercheuse de DeepSeek **Luo Fuli** — l’a conçu autour de deux idées : un **schéma d’attention hybride** qui mélange Sliding Window Attention (SWA) et Global Attention (GA) selon un ratio de 6:1 (réduction d’environ 7× du cache KV avec une fenêtre de 128 tokens), et **3 modules légers de Multi-Token Prediction (MTP)** qui offrent environ **3× de vitesse de sortie** sur des charges autoregressives. L’architecture comporte 70 couches (1 dense + 69 MoE), une taille cachée de 6144, et est livrée nativement en **précision mixte FP8 E4M3**.

Deux points comptent pour les utilisateurs de Clore.ai. D’abord, il s’agit de la **première version MiMo Pro avec poids publics** : les variantes Pro précédentes n’existaient que comme API hébergée et comme modèle « Hunter Alpha » testé en mode furtif sur OpenRouter (calendrier de mars 2026). Ensuite, la **licence MIT** supprime purement et simplement les restrictions commerciales — affinez, redistribuez, exécutez-le comme un point de terminaison payant, sans réserve. L’annonce de lancement de Xiaomi affirme que V2.5-Pro **surpasse DeepSeek V4 sur les tâches agentiques**, mais ce benchmark n’est publié que par l’éditeur — aucune reproduction tierce n’a encore été obtenue, et vous ne devriez pas le citer à l’extérieur sans cette réserve.

### Spécifications clés

| Propriété           | Valeur                                                                    |
| ------------------- | ------------------------------------------------------------------------- |
| Paramètres totaux   | 1.02T (MoE)                                                               |
| Paramètres actifs   | ≈42B par passage avant                                                    |
| Fenêtre de contexte | 1 000 000 tokens (1M)                                                     |
| Précision           | FP8 E4M3 mixte (natif)                                                    |
| Architecture        | SWA + GA hybride (6:1), 70 couches (1 dense + 69 MoE), caché 6144         |
| Cache KV            | Fenêtre glissante 128, réduction d’environ 7× par rapport à la GA globale |
| Décodage spéculatif | 3 modules MTP légers, vitesse de sortie \~3×                              |
| Licence             | MIT                                                                       |
| Date de sortie      | 27 avril 2026                                                             |
| Organisation        | Équipe Xiaomi MiMo (XiaomiMiMo sur HuggingFace)                           |
| Outils principaux   | SGLang (prioritaire), vLLM                                                |

### Pourquoi MiMo-V2.5-Pro ?

* **Premier MiMo du niveau Pro à poids ouverts** — le prédécesseur MiMo-V2-Pro était uniquement disponible via API, c’est la première fois que les poids Pro sont publics
* **contexte de 1M tokens** — gère des bases de code entières, de longues traces d’agents ou du RAG multi-document sans découpage
* **attention hybride** — SWA + GA à 6:1 réduit le cache KV d’environ 7× par rapport à une attention globale pure ; les longs contextes restent gérables
* **FP8 natif** — pas de quantification a posteriori, les poids sont livrés en FP8 E4M3 directement par l’éditeur
* **décodage spéculatif MTP** — 3 modules MTP intégrés offrent environ 3× de débit de décodage prêts à l’emploi
* **licence MIT** — aucune restriction commerciale, aucune limite d’usage
* **42B actifs** — vous payez le coût d’inférence dense d’un modèle 42B malgré le chiffre phare de 1.02T
* **Lignée** — la chercheuse principale Luo Fuli était auparavant chez DeepSeek, et les choix architecturaux le montrent

***

## Exigences

{% hint style="warning" %}
**Les configurations multi-GPU de classe 80 Go ne sont pas répertoriées sur la place de marché Clore.ai.** Les plus grosses machines répertoriées aujourd’hui sont 4× RTX PRO 6000 Blackwell (96 Go chacune, 380 Go au total) et 8–11× RTX 5090 (32 Go chacune). La capacité A100 / H200 / B200 est proposée en bare metal sur demande. Consultez [bare metal](https://clore.ai/bare-metal) sur demande. Consultez [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md) avant de dimensionner un déploiement.
{% endhint %}

{% hint style="warning" %}
**Toujours un modèle 1T.** "42B actifs" semble rassurant, mais les poids complets de 1.02T doivent résider en VRAM (ou être déchargés de façon agressive). Les poids FP8 natifs nécessitent **\~600 Go+ de VRAM** avant la mémoire d’activation et le cache KV. Prévoyez 8×H200 ou plus pour du FP8 avec contexte complet.
{% endhint %}

| Composant | Minimum (quant + déchargement, futur)                                   | Recommandé (FP8)       | FP8 complet, contexte 1M  |
| --------- | ----------------------------------------------------------------------- | ---------------------- | ------------------------- |
| VRAM GPU  | \~141 Go (Q4 + déchargement RAM, lorsque les quants seront disponibles) | 8× H100 80 Go (640 Go) | 8× H200 141 Go (1 128 Go) |
| RAM       | 256 Go                                                                  | 512 Go                 | 512 Go                    |
| Disque    | 700 Go NVMe                                                             | 1,5 To NVMe            | 2 To NVMe                 |
| CUDA      | 12.8+                                                                   | 12.8+                  | 12.8+                     |

**Adéquation matérielle :** Pour du FP8 complet avec une marge confortable sur le contexte 1M, **8×H200** est la cible naturelle — il s’agit d’un [bare metal](https://clore.ai/bare-metal) déploiement, pas d’une location sur la place de marché — voir [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html). 8×H100 80 Go peut aussi exécuter le checkpoint FP8, mais vous devrez plafonner `--context-length` plus bas (généralement 256K) pour laisser de la place au cache KV. Pour le matériel de classe Blackwell, voir [clore.ai/rent-b200.html](https://clore.ai/rent-b200.html).

***

## Option A — Ollama / GGUF (quantifié, builds communautaires)

{% hint style="warning" %}
**Attention :** Au 28 avril 2026 (un jour après la sortie) **les quants GGUF communautaires pour MiMo-V2.5-Pro ne sont pas encore publiés**. Attendez-vous à voir apparaître des builds Q4\_K\_M / Q5\_K\_M / Q6\_K d’ici 1 à 2 semaines sur [huggingface.co/models?search=mimo-v2.5-pro+gguf](https://huggingface.co/models?search=mimo-v2.5-pro+gguf). En attendant, le FP8 via SGLang ou vLLM est la voie prise en charge.
{% endhint %}

```bash
# Une fois qu’un build Q4_K_M est disponible
docker exec ollama ollama pull mimo-v2.5-pro:q4_K_M
docker exec ollama ollama run mimo-v2.5-pro:q4_K_M

# Ou avec llama.cpp directement sur un fichier GGUF (une fois publié)
docker run --gpus all -it --rm -p 8080:8080 \
  -v $(pwd)/models:/models \
  ghcr.io/ggerganov/llama.cpp:server-cuda \
  -m /models/mimo-v2.5-pro-q4_k_m.gguf \
  --n-gpu-layers 99 --ctx-size 65536 \
  --port 8080 --host 0.0.0.0
```

***

## Option B — vLLM (API de production, recommandé)

vLLM prend en charge MiMo-V2.5-Pro via `--trust-remote-code` (l’attention hybride + les modules MTP sont fournis comme code personnalisé dans le dépôt). Utilisez les paramètres d’échantillonnage par défaut du fournisseur : **temperature 1.0, top\_p 0.95**.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model XiaomiMiMo/MiMo-V2.5-Pro
      --tensor-parallel-size 8
      --quantization fp8
      --max-model-len 262144
      --gpu-memory-utilization 0.90
      --trust-remote-code
      --served-model-name mimo-v2.5-pro
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Testez l’API (échantillonnage recommandé par l’éditeur)
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mimo-v2.5-pro",
    "messages": [
      {"role": "system", "content": "Vous êtes un agent de codage autonome."},
      {"role": "user", "content": "Parcourez ce monorepo de 30 K lignes et proposez un plan de migration d’Express 4 vers Fastify 5."}
    ],
    "max_tokens": 8192,
    "temperature": 1.0,
    "top_p": 0.95
  }'
```

{% hint style="info" %}
Sur 8×H100 80 Go, plafonnez `--max-model-len` à 262144 (256K) pour laisser de la marge pour les activations + le cache KV. Sur 8×H200 141 Go, vous pouvez confortablement monter à 524288 ou plus ; 1 048 576 (1M complet) est faisable, mais attendez-vous à de longs temps de préremplissage — testez avant de vous y fier.
{% endhint %}

***

## Option C — SGLang (recommandé pour un débit maximal)

SGLang est la **cible de service de premier plan** dans la fiche du modèle MiMo-V2.5-Pro. L’éditeur publie la commande de lancement avec **`SGLANG_ENABLE_SPEC_V2=1`** pour activer le nouveau chemin de décodage spéculatif conscient du MTP, là où le gain d’environ 3× sur le décodage se matérialise réellement.

```bash
docker pull lmsysorg/sglang:latest

# Repris textuellement de la fiche du modèle HF
SGLANG_ENABLE_SPEC_V2=1 python3 -m sglang.launch_server \
    --model-path XiaomiMiMo/MiMo-V2.5-Pro \
    --trust-remote-code \
    --quantization fp8 \
    --context-length 1048576 \
    --host 0.0.0.0 --port 9001
```

Pour une configuration TP multi-GPU sur 8×H200, ajoutez `--tp-size 8` et `--mem-fraction-static 0.88`. Vérifiez avec `nvidia-smi` que les 8 cartes sont bien présentes avant d’envoyer du trafic réel — le contexte 1M ne pardonne pas si un rang est sous-alimenté.

***

## Recommandations GPU Clore.ai

| Configuration  | VRAM     | Performances attendues                                    | Coût Clore.ai                             |
| -------------- | -------- | --------------------------------------------------------- | ----------------------------------------- |
| 4× H100 80 Go  | 320 Go   | FP8 avec déchargement lourd, ctx max \~64K, \~10–15 tok/s | \~4,16 $/h                                |
| 8× H100 80 Go  | 640 Go   | FP8 complet, ctx max \~256K, \~30–45 tok/s                | \~8,32 $/h                                |
| 8× H200 141 Go | 1 128 Go | FP8 complet, ctx max 1M, \~60+ tok/s avec MTP             | [bare metal](https://clore.ai/bare-metal) |
| 8× B200        | 1 536 Go | FP8 complet, ctx max 1M, le plus rapide disponible        | tarification de la place de marché        |

{% hint style="success" %}
**Meilleure qualité :** 8× H200 141 Go sur le checkpoint FP8 ([bare metal](https://clore.ai/bare-metal)) avec `SGLANG_ENABLE_SPEC_V2=1`. Vous obtenez la fenêtre de contexte complète de 1M, le décodage spéculatif MTP et suffisamment de marge de cache KV pour de vraies boucles d’agents. Voir [clore.ai/rent-h200.html](https://clore.ai/rent-h200.html) pour la disponibilité en temps réel.
{% endhint %}

***

## Cas d’usage

* **Agents à long horizon** — l’équipe MiMo calibre explicitement le modèle pour un appel d’outils soutenu. Le contexte 1M plus l’accélération MTP permettent des milliers de tours d’outils sans gymnastique de découpage.
* **Analyse de base de code entière** — placez un monorepo de 500K tokens dans le contexte pour la planification de refactorisation, les audits de dépendances ou la conception de migration
* **RAG sur longs documents** — des livres entiers, des transcriptions clients sur plusieurs années ou des historiques de chat sur un an tiennent dans un seul prompt
* **Codage** — le score HumanEval+ 75,6 % revendiqué par l’éditeur et la posture agentique en font un candidat pour des charges SWE autonomes (à associer avec SWE-agent / OpenHands)
* **Carnet de recherche** — le contexte 1M tolère ce type d’usage « collez tout l’article, collez les travaux antérieurs, demandez une synthèse » que les petits modèles tronquent

***

## Benchmarks

{% hint style="warning" %}
**Revendiqué par l’éditeur — aucune reproduction tierce pour l’instant.** Tous les chiffres ci-dessous proviennent de l’annonce du 27 avril 2026 de Xiaomi et de la fiche modèle HuggingFace. Le modèle n’a que **deux jours** au moment de la rédaction — les reproductions indépendantes sur les benchmarks agentiques et à long contexte sont encore en attente. La revendication « surpasse DeepSeek V4 sur les tâches agentiques » vient en particulier du propre billet de Xiaomi ; considérez-la comme du marketing tant qu’elle n’est pas reproduite.
{% endhint %}

| Benchmark                            | MiMo-V2.5-Pro (éditeur) | Remarques                                        |
| ------------------------------------ | ----------------------- | ------------------------------------------------ |
| GSM8K                                | **99.6%**               | Problèmes de mots en mathématiques               |
| HumanEval+                           | 75.6%                   | Codage (étendu)                                  |
| MMLU                                 | 89.4%                   | Connaissances générales                          |
| GraphWalks (1M ctx) BFS              | 0.37                    | Parcours de graphe à long contexte               |
| GraphWalks (1M ctx) Parents          | 0.62                    | Parcours de graphe à long contexte               |
| Tâches agentiques face à DeepSeek V4 | "surpasse" (éditeur)    | **Non vérifié — reproduction tierce en attente** |

***

## Dépannage

| Problème                                        | Solution                                                                                                                                        |
| ----------------------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` au chargement                | Le FP8 natif nécessite encore \~600 Go+ de VRAM. Utilisez 8× H200 ou réduisez `--context-length` à 65536 sur 8× H100.                           |
| Téléchargement HuggingFace lent                 | `huggingface-cli download XiaomiMiMo/MiMo-V2.5-Pro --local-dir ./weights --resume-download`. Attendez-vous à environ 600 Go de FP8.             |
| `--trust-remote-code` refusé                    | L’attention hybride et MTP sont livrés comme code personnalisé dans le dépôt. L’indicateur est **obligatoire** pour vLLM et SGLang.             |
| Accélération MTP absente dans SGLang            | Vérifiez `SGLANG_ENABLE_SPEC_V2=1` est exporté dans le même shell que `python3 -m sglang.launch_server`. Le chemin par défaut n’active pas MTP. |
| Trace de raisonnement plate / de faible qualité | Utilisez `temperature=1.0` et `top_p=0.95`. Des températures plus basses dégradent le comportement de raisonnement de MiMo.                     |
| OOM du contexte 1M sur 8× H100                  | 8× H100 80 Go ne peut pas contenir le cache KV pour 1M tokens. Plafonnez à 256K ou passez à 8× H200.                                            |
| Le préremplissage prend plusieurs minutes       | Attendu à un contexte 1M. Utilisez `--enable-chunked-prefill` (vLLM) ou regroupez des requêtes plus courtes pour les charges interactives.      |
| L’extraction GGUF / Ollama échoue               | Les quants communautaires ne sont pas publiés au 28 avril 2026. Attendez 1 à 2 semaines ou utilisez directement FP8.                            |

***

## Prochaines étapes

* **Prédécesseur / modèle frère :** [MiMo-V2-Flash](/guides/guides_v2-fr/modeles-de-langage/mimo-v2-flash.md) — 309B MoE, 15B actifs, contexte 32K, plus rapide mais plus petit
* **Concurrent revendiqué par l’éditeur :** [DeepSeek V4](/guides/guides_v2-fr/modeles-de-langage/deepseek-v4.md) — 1M ctx, multimodal, \~1T paramètres (le modèle que Xiaomi dit avoir battu sur les tâches agentiques)
* **Concurrent open-weight pour le codage :** [GLM-5.1](/guides/guides_v2-fr/modeles-de-langage/glm-5-1.md) — 744B MoE, 40B actifs, MIT, actuellement n°1 sur SWE-Bench Pro
* **Capacité H200 :** [bare metal sur demande](https://clore.ai/bare-metal) — meilleur choix pour un MoE 1T FP8 complet avec contexte 1M
* **Place de marché Clore.ai :** [clore.ai/marketplace](https://clore.ai/marketplace)

### Liens

* [MiMo-V2.5-Pro sur HuggingFace](https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro)
* [organisation Xiaomi MiMo sur HuggingFace](https://huggingface.co/XiaomiMiMo)
* [dépôt SGLang](https://github.com/sgl-project/sglang)
* [documentation vLLM](https://docs.vllm.ai)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mimo-v25-pro.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
