> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/minimax-m3.md).

# MiniMax M3 (428B multimodal)

Déployez MiniMax M3, un MoE multimodal natif de 428B avec un contexte de 1M de tokens, sur des configurations Clore.ai multi-GPU

{% hint style="info" %}
**Statut (août 2026) :** MiniMax a publié **M3** le **1er juin 2026**avec les poids sur Hugging Face d’ici le 7 juin : [MiniMaxAI/MiniMax-M3](https://huggingface.co/MiniMaxAI/MiniMax-M3). **428B au total / \~23B actifs**, **contexte de 1M tokens**, native **texte + image + vidéo** entrée, sous une licence **`minimax-community`** personnalisée (ni Apache ni MIT — lisez-la avant une utilisation commerciale).
{% endhint %}

La propriété intéressante de M3 n’est pas sa taille, c’est son attention. **MiniMax Sparse Attention (MSA)** réduit le calcul par jeton à 1M de contexte à environ **1/20** de l’attention à requête groupée, offrant à MiniMax un **préremplissage 9× plus rapide et décodage 15× plus rapide** que M2 à plein contexte. Pour le travail sur les longs documents et les longues vidéos, c’est la différence entre un modèle pour lequel vous pouvez vous permettre de remplir la fenêtre et un autre pour lequel vous ne le pouvez pas.

Avec seulement \~23B de paramètres actifs par jeton, la vitesse de décodage sur une version quantifiée se rapproche davantage de celle d’un modèle de taille moyenne que de celle d’un modèle de 428B.

### Spécifications clés

| Propriété         | Valeur                                                                     |
| ----------------- | -------------------------------------------------------------------------- |
| Paramètres        | 428B au total, \~23B actifs (MoE)                                          |
| Architecture      | 60 couches, GQA + MiniMax Sparse Attention, encodeur visuel natif          |
| Modalité          | Texte, image, vidéo en entrée → texte en sortie                            |
| Contexte          | 1 000 000 jetons                                                           |
| Licence           | `minimax-community` (personnalisé, soumis à des restrictions commerciales) |
| Date de sortie    | 1er juin 2026                                                              |
| Poids             | BF16 854 Go · Q2\_K\_XL GGUF 143 Go · Q3\_K\_M GGUF 195 Go                 |
| Outils principaux | vLLM, SGLang, llama.cpp, Transformers                                      |

***

## Exigences

| Construction   | Taille   | configuration Clore.ai                                                 |
| -------------- | -------- | ---------------------------------------------------------------------- |
| `UD-IQ1_M`     | 128 Go   | 6× RTX 5090 (186 Go) — confortable                                     |
| `UD-Q2_K_XL`   | 143 Go   | 6× RTX 5090 ou 8× RTX 4090 (192 Go)                                    |
| `UD-Q3_K_M`    | 195 Go   | 8× RTX 5090 (248 Go)                                                   |
| `UD-Q4_K_S`    | 248 Go   | 10× RTX 5090 (310 Go) ou 4× RTX PRO 6000 (380 Go)                      |
| MXFP8 officiel | \~430 Go | Pas sur la place de marché → [bare metal](https://clore.ai/bare-metal) |
| BF16 officiel  | 854 Go   | [bare metal](https://clore.ai/bare-metal)                              |

Au dernier instantané, il y avait **72 serveurs avec ≥167 Go de VRAM (26 libres)** et **54 avec ≥192 Go (14 libres)** — assez pour placer une version Q2 ou Q3, mais pas assez pour supposer qu’il y en aura une prête.

{% hint style="warning" %}
L’entrée multimodale nécessite que la tour visuelle soit chargée en même temps que le modèle de langage. Prévoyez quelques Go supplémentaires par rapport à la taille quantifiée si vous comptez lui fournir des images ou de la vidéo, et privilégiez des configurations disposant de beaucoup de RAM système pour le décodage vidéo.
{% endhint %}

***

## Déployer avec llama.cpp

```bash
huggingface-cli download unsloth/MiniMax-M3-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/m3

llama-server -m /workspace/m3/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer \\
  -c 262144 --flash-attn --no-mmap
```

## Déployer avec vLLM

```bash
vllm serve MiniMaxAI/MiniMax-M3 \\
  --tensor-parallel-size 8 \
  --trust-remote-code \\
  --max-model-len 262144 \\
  --gpu-memory-utilization 0.92 \\
  --enable-expert-parallel
```

Points de contrôle pré-quantifiés : [`MiniMaxAI/MiniMax-M3-MXFP8`](https://huggingface.co/MiniMaxAI/MiniMax-M3-MXFP8) (officiel), [`nvidia/MiniMax-M3-NVFP4`](https://huggingface.co/nvidia/MiniMax-M3-NVFP4) pour Blackwell, [`cyankiwi/MiniMax-M3-AWQ-INT4`](https://huggingface.co/cyankiwi/MiniMax-M3-AWQ-INT4) pour les piles AWQ.

***

## Recommandations GPU Clore.ai

| Configuration   | VRAM totale | Construction | Coût Clore.ai       |
| --------------- | ----------- | ------------ | ------------------- |
| 6× RTX 5090     | 186 Go      | Q2\_K\_XL    | \~1,50–2,60 $/h     |
| 8× RTX 4090     | 192GB       | Q2\_K\_XL    | \~1,12–3,36 $/h     |
| **8× RTX 5090** | **248 Go**  | **Q3\_K\_M** | **\~2,00–3,50 $/h** |
| 4× RTX PRO 6000 | 380GB       | Q4\_K\_S     | \~5,00 $/h          |

***

## Cas d’usage

* **Compréhension de longues vidéos** — entrée vidéo native plus la courbe de coût de l’attention clairsemée
* **Analyse de documents d’un million de jetons** — contrats, bases de code, archives en un seul passage
* **Codage agentique et tâches de « cowork »** — ce pour quoi MiniMax a optimisé M3
* **Décodage peu coûteux à l’échelle frontier** — 23B de paramètres actifs signifie que les jetons sortent rapidement pour la taille du modèle
* **RAG multimodal** — un seul modèle pour le texte, les captures d’écran et les images de vidéo

{% hint style="warning" %}
**Vérifiez la licence avant toute utilisation commerciale.** M3 est distribué sous `minimax-community`et non sous une licence OSI. Si vous avez besoin de conditions sans restriction, [GLM-5.2](/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md) est MIT et [Qwen3.8-27B](/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md) est Apache 2.0.
{% endhint %}

***

## Dépannage

| Problème                                 | Correctif                                                                                                                        |
| ---------------------------------------- | -------------------------------------------------------------------------------------------------------------------------------- |
| `trust_remote_code` erreurs              | M3 fournit du code de modélisation personnalisé — passez `--trust-remote-code` dans vLLM                                         |
| Kernels d’attention clairsemée manquants | Mettez à jour vLLM/SGLang ; la prise en charge de MSA est arrivée après la publication de juin                                   |
| L’entrée vidéo échoue                    | Vérifiez que la configuration dispose de suffisamment de RAM système et de CPU pour le décodage ; la vidéo est décodée côté hôte |
| OOM à 1M de contexte                     | Le cache KV est plus petit que GQA, mais pas gratuit — commencez à 262K et augmentez progressivement                             |
| Préremplissage lent                      | Activez le préremplissage par blocs ; l’avantage de MSA apparaît sur les longs contextes, pas sur les courts prompts             |

***

## Étapes suivantes

* **Prédécesseur :** [MiniMax M2.7](/guides/guides_v2-fr/modeles-de-langage/minimax-m27.md) — le MoE de codage d’avril
* **Alternative MIT à une échelle similaire :** [GLM-5.2](/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md)
* **Alternative mono-carte :** [Qwen3.8-27B](/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md)
* **Dimensionnement de la configuration :** [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md)

### Liens

* [MiniMax M3 sur Hugging Face](https://huggingface.co/MiniMaxAI/MiniMax-M3) · [GGUF](https://huggingface.co/unsloth/MiniMax-M3-GGUF)
* [Rapport technique (arXiv 2606.13392)](https://arxiv.org/abs/2606.13392) · [dépôt MSA](https://github.com/MiniMax-AI/MSA)
* [GitHub MiniMax-M3](https://github.com/MiniMax-AI/MiniMax-M3)
* **Louez un GPU :** [RTX 5090](https://clore.ai/rent-5090.html) · [RTX 4090](https://clore.ai/rent-4090.html) · [Place de marché](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/minimax-m3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
