> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md).

# GLM-5.2 (MIT, contexte 1M)

Exécutez GLM-5.2, le modèle phare de codage à contexte 1M sous licence MIT de Z.ai, sur une grande configuration multi-GPU du marketplace Clore.ai

{% hint style="info" %}
**Statut (août 2026) :** Z.ai a publié **GLM-5.2** le **13 juin 2026** sous la **licence MIT** — pas de limites régionales, pas de clause de revenus. Poids : [zai-org/GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) et [zai-org/GLM-5.2-FP8](https://huggingface.co/zai-org/GLM-5.2-FP8). MoE à attention clairsemée, environ **750B de paramètres au total avec \~40B actifs**, un **contexte solide d’1M de tokens**, et les meilleurs scores ouverts en codage publiés à ce jour.
{% endhint %}

GLM-5.1 était déjà le modèle ouvert à battre en génie logiciel. GLM-5.2 fait passer Terminal-Bench 2.1 de 63,5 à **81.0** et SWE-bench Pro de 58,4 à **62.1**, et il le fait avec une licence MIT pendant que le reste de la frontière se tournait vers des conditions personnalisées avec des seuils de revenus.

Le hic, c’est la taille. Le checkpoint FP8 fait **756 Go**. Ce n’est pas un modèle sur une seule carte, et il ne le sera jamais. Ce qui le rend intéressant sur Clore.ai, c’est que les builds quantifiés entrent dans le plafond des plus gros rigs du marketplace.

### Spécifications clés

| Propriété         | Valeur                                                                                   |
| ----------------- | ---------------------------------------------------------------------------------------- |
| Paramètres        | \~750B au total, \~40B actifs (MoE)                                                      |
| Architecture      | 78 couches, 256 experts routés, 8 actifs par token, attention clairsemée IndexShare, MTP |
| Contexte          | 1 000 000 de tokens                                                                      |
| Licence           | MIT                                                                                      |
| Date de sortie    | 13 juin 2026                                                                             |
| Poids             | FP8 756 Go · Q2\_K\_XL GGUF 254 Go · IQ1\_S GGUF 217 Go                                  |
| Outils principaux | SGLang ≥ 0.5.13.post1, vLLM ≥ 0.23.0, llama.cpp                                          |

### Nouveautés par rapport à GLM-5.1

* **Contexte solide d’1M** — pas un chiffre accrocheur, mais une fenêtre qui tient la route sur les travaux à long horizon
* **IndexShare** — un seul indexeur réutilisé sur chaque groupe de quatre couches d’attention clairsemée, réduisant les FLOPs par token de **2,9× à 1M de contexte**
* **MTP amélioré** — longueur d’acceptation du décodage spéculatif augmentée jusqu’à 20 %
* **Effort de réflexion flexible** — arbitrer la latence contre la profondeur par requête
* **Toujours sous licence MIT** — les poids n’imposent aucune restriction d’utilisation

***

## Exigences

{% hint style="warning" %}
**Ce modèle a besoin d’un rig, pas d’une carte.** Le FP8 à 756 Go dépasse toutes les machines du marketplace Clore.ai. Les plus grosses configurations listées sont des 4× RTX PRO 6000 Blackwell (380 Go) et des 10–11× RTX 5090 (310–341 Go). Le GGUF quantifié est la seule voie ici ; l’inférence en pleine précision doit tourner sur [bare metal](https://clore.ai/bare-metal).
{% endhint %}

| Version      | Taille | Où il s’exécute sur Clore.ai                                       |
| ------------ | ------ | ------------------------------------------------------------------ |
| `UD-IQ1_S`   | 217 Go | 8× RTX 5090 (248 Go) — 47 serveurs listés à ≥242 Go                |
| `UD-IQ2_M`   | 239 Go | 8× RTX 5090, serré                                                 |
| `UD-Q2_K_XL` | 254 Go | 10× RTX 5090 (310 Go) ou 4× RTX PRO 6000 (380 Go)                  |
| `UD-Q3_K_M`  | 343 Go | 4× RTX PRO 6000 (380 Go) uniquement — 2 serveurs de ce type listés |
| `UD-IQ4_XS`  | 365 Go | 4× RTX PRO 6000, sans marge                                        |
| FP8 officiel | 756 Go | Pas sur le marketplace → [bare metal](https://clore.ai/bare-metal) |

Ajoutez 10–15 % à la taille des poids pour le cache KV et les activations aux longueurs de contexte d’exploitation, et vérifiez la RAM système : ces rigs ont besoin de suffisamment de mémoire pour préparer les poids au chargement.

***

## Déployer avec llama.cpp sur un rig multi-GPU

La voie réaliste sur le matériel du marketplace. Louez un rig 10× RTX 5090 (environ **$5.00/h** au dernier relevé) et répartissez le modèle sur toutes les cartes :

```bash
# ~254 Go — laissez un peu de marge au rig
huggingface-cli download unsloth/GLM-5.2-GGUF \
  --include "*UD-Q2_K_XL*" --local-dir /workspace/glm52

llama-server -m /workspace/glm52/*UD-Q2_K_XL*-00001-of-*.gguf \
  --host 0.0.0.0 --port 8080 \
  -ngl 999 --split-mode layer \
  -c 131072 --flash-attn \
  --no-mmap
```

{% hint style="info" %}
`--no-mmap` C’est important sur du matériel loué : les poids sont téléchargés à neuf sur un disque que vous ne conservez pas, et faire du mmap d’un fichier de 254 Go sur un disque lent transforme la latence du premier token en minutes. Prévoyez 30 à 60 minutes pour le téléchargement lui-même et choisissez un serveur avec une liaison rapide.
{% endhint %}

## Déployer avec vLLM ou SGLang (FP8, matériel dédié)

Si vous avez la capacité — bare metal ou votre propre cluster — Z.ai prend en charge directement les deux moteurs :

```bash
# vLLM >= 0.23.0
vllm serve zai-org/GLM-5.2-FP8 \
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \
  --enable-expert-parallel \
  --gpu-memory-utilization 0.92

# SGLang >= 0.5.13.post1
python3 -m sglang.launch_server \
  --model-path zai-org/GLM-5.2-FP8 \
  --tp 8 --context-length 1000000 \
  --speculative-algorithm EAGLE
```

Checkpoints quantifiés prêts à l’emploi pour d’autres stacks : [`nvidia/GLM-5.2-NVFP4`](https://huggingface.co/nvidia/GLM-5.2-NVFP4) pour Blackwell, [`cyankiwi/GLM-5.2-AWQ-INT4`](https://huggingface.co/cyankiwi/GLM-5.2-AWQ-INT4) pour les stacks AWQ, [`amd/GLM-5.2-MXFP4`](https://huggingface.co/amd/GLM-5.2-MXFP4) pour Instinct.

***

## Recommandations GPU Clore.ai

| Configuration             | VRAM totale | Version                  | Coût Clore.ai                             |
| ------------------------- | ----------- | ------------------------ | ----------------------------------------- |
| 8× RTX 5090               | 248 Go      | IQ1\_S / IQ2\_M          | \~2,00–3,50 $/h                           |
| **10× RTX 5090**          | **310 Go**  | **Q2\_K\_XL**            | **\~5,00 $/h**                            |
| 4× RTX PRO 6000 Blackwell | 380 Go      | Q2\_K\_XL ou Q3\_K\_M    | \~5,00 $/h                                |
| 8× H200 dédiés            | 1 128 Go    | FP8, contexte complet 1M | [bare metal](https://clore.ai/bare-metal) |

Il n’existe à tout moment qu’une poignée de rigs de cette taille — 47 serveurs à ≥242 Go, dont 9 libres au dernier relevé. Vérifiez le marketplace avant de planifier autour d’un tel rig.

***

## Benchmarks

D’après la fiche modèle de Z.ai elle-même (13 juin 2026). Des reproductions indépendantes existent pour les suites de codage ; considérez les chiffres de raisonnement comme fournis par l’éditeur.

| Benchmark                                  | GLM-5.2  | GLM-5.1 | DeepSeek-V4-Pro (Aperçu) | MiniMax M3 |
| ------------------------------------------ | -------- | ------- | ------------------------ | ---------- |
| Terminal-Bench 2.1 (Terminus-2)            | **81.0** | 63.5    | 64                       | 65         |
| Terminal-Bench 2.1 (meilleur banc d’essai) | **82.7** | 69      | —                        | —          |
| SWE-bench Pro                              | **62.1** | 58.4    | 55.4                     | 59         |
| NL2Repo                                    | **48.9** | 42.7    | 35.5                     | 42.1       |
| DeepSWE                                    | **46.2** | 18      | 8                        | 20         |
| HLE                                        | 40.5     | 31      | 37.7                     | 37         |
| AIME 2026                                  | 99.2     | 95.3    | 94.6                     | —          |
| GPQA-Diamond                               | 91.2     | 86.2    | 90.1                     | 93         |

***

## Cas d’usage

* **Agents de codage autonomes** — les gains sur Terminal-Bench et DeepSWE correspondent exactement au comportement à long horizon dont les agents ont besoin
* **Raisonnement sur dépôt entier** — contexte d’1M avec attention clairsemée qui reste abordable sur la durée
* **Travaux de migration et de refactorisation** — NL2Repo mesure la construction d’un dépôt à partir d’une spécification, et GLM-5.2 mène dans le champ ouvert
* **Alternative auto-hébergée aux API fermées de pointe** — MIT signifie que vous pouvez l’intégrer dans un produit
* **Cadres d’évaluation par lots** — louez un gros rig à la minute, lancez le balayage, clôturez la commande

***

## Dépannage

| Problème                                 | Correctif                                                                                                                            |
| ---------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------ |
| Le téléchargement prend une éternité     | 254 Go en Q2 — filtrez le marketplace pour des serveurs à haut débit et utilisez `--include` pour récupérer une seule quantification |
| OOM réparti sur plusieurs GPU            | `--split-mode layer` dans llama.cpp ; dans vLLM, augmentez `--tensor-parallel-size` au nombre total de GPU                           |
| Le premier token prend des minutes       | Supprimez `--mmap`, gardez le modèle sur NVMe local, et préchauffez avec une courte invite                                           |
| vLLM rejette la configuration            | Nécessite ≥ 0.23.0 ; SGLang nécessite ≥ 0.5.13.post1                                                                                 |
| La qualité semble dégradée en IQ1        | C’est une version 1 bit d’un modèle de 750B. Passez à Q2\_K\_XL ou plus si le rig le permet                                          |
| Le rig disparaît en plein téléchargement | Quelqu’un d’autre l’a loué. Utilisez la location à la demande plutôt que le spot pour les longs travaux de configuration             |

***

## Étapes suivantes

* **Prédécesseur :** [GLM-5.1](/guides/guides_v2-fr/modeles-de-langage/glm-5-1.md) — la sortie d’avril 744B
* **Tient plutôt sur une seule carte :** [Qwen3.8-27B](/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md) — Apache 2.0, 15 Go en Q4
* **Même catégorie de taille :** [MiniMax M3](/guides/guides_v2-fr/modeles-de-langage/minimax-m3.md) · [Nemotron 3 Ultra](/guides/guides_v2-fr/modeles-de-langage/nemotron-3-ultra.md) · [DeepSeek V4](/guides/guides_v2-fr/modeles-de-langage/deepseek-v4.md)
* **Dimensionnement du rig :** [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md) · [Configuration multi-GPU](/guides/guides_v2-fr/avance/multi-gpu-setup.md)

### Liens

* [GLM-5.2 sur Hugging Face](https://huggingface.co/zai-org/GLM-5.2) · [FP8](https://huggingface.co/zai-org/GLM-5.2-FP8) · [GGUF](https://huggingface.co/unsloth/GLM-5.2-GGUF)
* [Blog Z.ai](https://z.ai/blog/glm-5.2) · [GitHub GLM-5](https://github.com/zai-org/GLM-5)
* [Recette vLLM](https://recipes.vllm.ai/zai-org/GLM-5.2) · [Livre de cuisine SGLang](https://cookbook.sglang.io/autoregressive/GLM/GLM-5.2)
* **Louez un GPU :** [RTX 5090](https://clore.ai/rent-5090.html) · [Place de marché](https://clore.ai/marketplace) · [Bare metal](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
