> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-small4.md).

# Mistral Small 4 (MoE 119B, 6,5B actifs)

Déployez Mistral Small 4 (MoE 119B, 6,5B actifs) sur deux GPU grand public du marketplace Clore.ai — Apache 2.0, contexte 256K, vision et raisonnement dans un seul modèle

{% hint style="info" %}
**Statut (août 2026) :** Mistral a publié **Small 4** le **16 mars 2026** sous **Apache 2.0**. Poids : [mistralai/Mistral-Small-4-119B-2603](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603). **119 milliards de paramètres au total, avec seulement 6,5 milliards actifs** (128 experts, 4 actifs par jeton), **contexte de 256K**, native **vision**, et un commutateur de raisonnement par requête. Il regroupe les trois lignes précédentes de Mistral — Instruct, raisonnement Magistral et codage Devstral — en un seul checkpoint.
{% endhint %}

« Small » est un abus de langage en termes de nombre de paramètres et parfaitement exact en termes de coût. Seuls **6,5 milliards de paramètres s'activent par jeton**, donc la vitesse de décodage ressemble à celle d'un modèle 7B tandis que la qualité provient d'un pool de 119B. Quantifié en Q2, il nécessite **40 Go** — deux RTX 4090, pour lesquelles la place de marché Clore.ai dispose d'une capacité libre équivalente à 322 serveurs. En Q3–Q4, il fait 54–59 Go, à l'aise sur deux RTX 5090.

Si vous voulez un seul modèle ouvert qui réponde instantanément aux requêtes simples, raisonne davantage lorsqu'on lui demande, lise des images et écrive du code, c'est actuellement le meilleur choix pour du matériel que vous pouvez réellement louer à la minute.

### Spécifications clés

| Propriété         | Valeur                                                                        |
| ----------------- | ----------------------------------------------------------------------------- |
| Paramètres        | 119 milliards au total, 6,5 milliards actifs (128 experts, 4 actifs)          |
| Modalité          | Texte + image en entrée → texte en sortie                                     |
| Contexte          | 262 144 jetons (256K)                                                         |
| Licence           | Apache 2.0                                                                    |
| Date de sortie    | 16 mars 2026                                                                  |
| Poids             | Officiel \~242 Go · Q3\_K\_M GGUF 54 Go · Q2\_K\_XL GGUF 40 Go                |
| Raisonnement      | `reasoning_effort`: `none` (instantané) ou `élevé` (calcul au moment du test) |
| Outils principaux | vLLM, llama.cpp, Transformers                                                 |

***

## Exigences

| Construction        | Taille   | Configuration Clore.ai                                        |
| ------------------- | -------- | ------------------------------------------------------------- |
| `UD-IQ1_M`          | 32 Go    | 1× RTX PRO 6000 96 Go, ou 2× RTX 4090                         |
| `UD-Q2_K_XL`        | 40 Go    | **2× RTX 4090 / 3090 (48 Go)** — 322 serveurs libres à ≥48 Go |
| `UD-Q3_K_M`         | 54 Go    | 2× RTX 5090 (64 Go)                                           |
| `UD-IQ4_NL`         | 59 Go    | 2× RTX 5090 (64 Go)                                           |
| Checkpoint officiel | \~242 Go | 8× RTX 5090 (248 Go)                                          |

Ajoutez une marge pour le cache KV : à 256K de contexte, il est conséquent même avec un MoE aussi clairsemé. Commencez à 32–64K et augmentez une fois que vous voyez l'utilisation réelle.

***

## Déployer avec llama.cpp (deux cartes grand public)

```bash
huggingface-cli download unsloth/Mistral-Small-4-119B-2603-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/ms4

llama-server -m /workspace/ms4/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer \\
  -c 65536 --flash-attn
```

## Déployer avec vLLM

```bash
vllm serve mistralai/Mistral-Small-4-119B-2603 \\
  --tensor-parallel-size 8 \
  --tokenizer-mode mistral \\
  --config-format mistral \\
  --load-format mistral \\
  --max-model-len 262144 \\
  --enable-expert-parallel
```

Une version officielle NVFP4 ([`mistralai/Mistral-Small-4-119B-2603-NVFP4`](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603-NVFP4)) cible les cartes Blackwell — utile sur les configurations RTX 50-series et RTX PRO 6000.

## Raisonnement à la demande

```python
client.chat.completions.create(
    model="mistral-small-4",
    messages=[{"role": "user", "content": "Trouvez l'interblocage dans ce planificateur."}],
    extra_body={"reasoning_effort": "high"},   # "none" pour des réponses instantanées
    temperature=0.7,                            # 0.0–0.7 lorsque le raisonnement est désactivé
)
```

Mistral recommande une température de 0.7 avec le raisonnement activé. Avec le raisonnement désactivé, restez entre 0.0 et 0.7 selon le degré de déterminisme souhaité pour la sortie.

***

## Recommandations GPU Clore.ai

| Configuration   | VRAM   | Construction           | Contexte     | Coût Clore.ai     |
| --------------- | ------ | ---------------------- | ------------ | ----------------- |
| **2× RTX 4090** | 48GB   | Q2\_K\_XL              | \~64K        | **0,28–0,84 $/h** |
| 2× RTX 3090     | 48GB   | Q2\_K\_XL              | \~64K        | 0,14–0,42 $/h     |
| **2× RTX 5090** | 64 Go  | Q3\_K\_M / IQ4\_NL     | \~96K        | **0,50–1,54 $/h** |
| 1× RTX PRO 6000 | 96GB   | Q3\_K\_M, carte unique | \~131K       | 0,92–1,38 $/h     |
| 8× RTX 5090     | 248 Go | checkpoint officiel    | 256K complet | \~2,00–3,50 $/h   |

{% hint style="success" %}
**Une paire de RTX 3090 est le meilleur rapport qualité-prix** — 48 Go de VRAM pour environ 0,14–0,42 $/h au total, pour faire tourner un modèle 119B. Utilisez [location partielle de GPU](/guides/guides_v2-fr/premiers-pas/partial-gpu-rental.md) pour retirer deux cartes d'une configuration plus grande au lieu de chercher une machine double 3090 dédiée.
{% endhint %}

***

## Cas d’usage

* **Un seul modèle pour un produit entier** — chat, codage et raisonnement sans trois déploiements
* **Extraction de documents et d'images** — la vision plus un contexte de 256K gère les longs documents numérisés
* **Agents de codage à petit budget** — la lignée de Devstral, avec 6,5 milliards de paramètres actifs par jeton
* **Service par niveaux de latence** — `reasoning_effort : none` pour le chemin rapide, `élevé` pour le chemin difficile, même point de terminaison
* **Produits commerciaux** — Apache 2.0, sans clause de revenus, sans restriction régionale

***

## Dépannage

| Problème                                      | Correctif                                                                                                                   |
| --------------------------------------------- | --------------------------------------------------------------------------------------------------------------------------- |
| Erreurs de tokenizer vLLM                     | Les modèles Mistral nécessitent `--tokenizer-mode mistral --config-format mistral --load-format mistral`                    |
| OOM à 256K                                    | Le cache KV, pas les poids — réduisez `--max-model-len`                                                                     |
| Le raisonnement ne se déclenche jamais        | `reasoning_effort` est par requête ; vérifiez que votre client transmet `extra_body`                                        |
| Premier jeton lent sur 2 cartes               | Le GGUF réparti par couches via PCIe ajoute de la latence ; privilégiez des configurations avec des liaisons x8/x16         |
| La version NVFP4 ne parvient pas à se charger | Nécessite Blackwell — voir [Compatibilité CUDA et PyTorch](/guides/guides_v2-fr/premiers-pas/cuda-pytorch-compatibility.md) |

***

## Étapes suivantes

* **Petit frère :** [Mistral Small 3.1](/guides/guides_v2-fr/modeles-de-langage/mistral-small.md) — 24B dense, une carte
* **Grand frère :** [Mistral Large 3](/guides/guides_v2-fr/modeles-de-langage/mistral-large3.md) — 675B MoE
* **Alternative dense :** [Qwen3.8-27B](/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md) — 27B, une carte, Apache 2.0
* **Affinez-le :** [Unsloth](/guides/guides_v2-fr/entrainement/unsloth-finetune.md) · [LLaMA-Factory](/guides/guides_v2-fr/entrainement/llama-factory.md)

### Liens

* [Mistral Small 4 sur Hugging Face](https://huggingface.co/mistralai/Mistral-Small-4-119B-2603) · [GGUF](https://huggingface.co/unsloth/Mistral-Small-4-119B-2603-GGUF)
* [Annonce Mistral](https://mistral.ai/news/mistral-small-4/)
* **Louez un GPU :** [RTX 4090](https://clore.ai/rent-4090.html) · [RTX 5090](https://clore.ai/rent-5090.html) · [Place de marché](https://clore.ai/marketplace)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-small4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
