> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/glm-5-2.md).

# GLM-5.2 (MIT, 1M Kontext)

Führe GLM-5.2 aus, das MIT-lizenzierte 1M-Kontext-Coding-Flaggschiff von Z.ai, auf einem großen Multi-GPU-Rig aus dem Clore.ai-Marktplatz aus

{% hint style="info" %}
**Stand (August 2026):** Z.ai veröffentlichte **GLM-5.2** am **13. Juni 2026** unter der **MIT-Lizenz** — keine regionalen Beschränkungen, keine Umsatzklausel. Gewichte: [zai-org/GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) und [zai-org/GLM-5.2-FP8](https://huggingface.co/zai-org/GLM-5.2-FP8). MoE mit Sparse-Attention, ungefähr **750B Gesamtparameter mit \~40B aktiven**, ein **solider 1M-Token-Kontext**und die bisher veröffentlichten stärksten Open-Coding-Ergebnisse.
{% endhint %}

GLM-5.1 war bereits das offene Modell, das es in der Softwareentwicklung zu schlagen galt. GLM-5.2 hebt Terminal-Bench 2.1 von 63,5 auf **81.0** und SWE-bench Pro von 58,4 auf **62.1**, und das mit einer MIT-Lizenz, während der Rest der Frontier zu maßgeschneiderten Bedingungen mit Umsatzhürden überging.

Der Haken ist die Größe. Der FP8-Checkpoint ist **756 GB**. Dies ist kein Modell für eine einzelne Karte und wird es auch nie sein. Interessant an Clore.ai ist, dass die quantisierten Builds innerhalb der Obergrenze der größten Rigs auf dem Marktplatz liegen.

### Wichtige Spezifikationen

| Eigenschaft            | Wert                                                                                       |
| ---------------------- | ------------------------------------------------------------------------------------------ |
| Parameter              | \~750B insgesamt, \~40B aktiv (MoE)                                                        |
| Architektur            | 78 Schichten, 256 geroutete Experten, 8 aktive pro Token, IndexShare Sparse-Attention, MTP |
| Kontext                | 1.000.000 Tokens                                                                           |
| Lizenz                 | MIT                                                                                        |
| Veröffentlichungsdatum | 13. Juni 2026                                                                              |
| Gewichte               | FP8 756 GB · Q2\_K\_XL GGUF 254 GB · IQ1\_S GGUF 217 GB                                    |
| Primäre Tools          | SGLang ≥ 0.5.13.post1, vLLM ≥ 0.23.0, llama.cpp                                            |

### Was ist neu gegenüber GLM-5.1

* **Solider 1M-Kontext** — keine Schlagzeilenzahl, sondern ein Fenster, das sich bei Langzeitarbeit bewährt
* **IndexShare** — ein Indexer, der über jeweils vier Sparse-Attention-Schichten wiederverwendet wird und die FLOPs pro Token bei **um 2,9× bei 1M-Kontext**
* **Besseres MTP** — die Akzeptanzlänge beim spekulativen Dekodieren steigt um bis zu 20 %
* **Flexibler Denkaufwand** — Latenz gegen Tiefe pro Anfrage abwägen
* **Weiterhin MIT** — die Gewichte unterliegen keiner Nutzungsbeschränkung

***

## Anforderungen

{% hint style="warning" %}
**Dieses Modell braucht ein Rig, keine Karte.** FP8 mit 756 GB übersteigt jede Maschine auf dem Clore.ai-Marktplatz. Die größten gelisteten Systeme sind 4× RTX PRO 6000 Blackwell (380 GB) und 10–11× RTX 5090 (310–341 GB). Quantisierte GGUF-Builds sind hier der einzige Weg; der Betrieb in voller Präzision gehört auf [Bare Metal](https://clore.ai/bare-metal).
{% endhint %}

| Build           | Größe  | Wo es auf Clore.ai läuft                                             |
| --------------- | ------ | -------------------------------------------------------------------- |
| `UD-IQ1_S`      | 217 GB | 8× RTX 5090 (248 GB) — 47 Server mit mindestens 242 GB gelistet      |
| `UD-IQ2_M`      | 239 GB | 8× RTX 5090, knapp                                                   |
| `UD-Q2_K_XL`    | 254 GB | 10× RTX 5090 (310GB) oder 4× RTX PRO 6000 (380GB)                    |
| `UD-Q3_K_M`     | 343 GB | Nur 4× RTX PRO 6000 (380 GB) — 2 solche Server gelistet              |
| `UD-IQ4_XS`     | 365 GB | 4× RTX PRO 6000, kein Spielraum                                      |
| Offizielles FP8 | 756 GB | Nicht auf dem Marktplatz → [Bare Metal](https://clore.ai/bare-metal) |

Schlage für den KV-Cache und die Aktivierungen bei Arbeits-Kontextlängen 10–15 % auf die Modellgröße auf, und prüfe den Systemspeicher: Diese Rigs brauchen genug, um die Gewichte beim Laden zwischenzuspeichern.

***

## Bereitstellen mit llama.cpp auf einem Multi-GPU-Rig

Der realistische Weg auf Marktplatz-Hardware. Miete ein 10× RTX 5090 Rig (ungefähr **$5.00/hr** beim letzten Snapshot) und verteile das Modell auf alle Karten:

```bash
# ~254GB — lass dem Rig etwas Spielraum
huggingface-cli download unsloth/GLM-5.2-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/glm52

llama-server -m /workspace/glm52/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer \\
  -c 131072 --flash-attn \\
  --no-mmap
```

{% hint style="info" %}
`--no-mmap` Das ist auf gemieteter Hardware wichtig: Die Gewichte werden frisch auf eine Festplatte geladen, die dir nicht gehört, und das Mappen einer 254-GB-Datei über eine langsame Festplatte macht die Latenz bis zum ersten Token zu Minuten. Plane 30–60 Minuten allein für den Download ein und wähle einen Server mit schneller Verbindung.
{% endhint %}

## Bereitstellen mit vLLM oder SGLang (FP8, dedizierte Hardware)

Wenn du die Kapazität hast — Bare Metal oder dein eigener Cluster — unterstützt Z.ai beide Engines direkt:

```bash
# vLLM >= 0.23.0
vllm serve zai-org/GLM-5.2-FP8 \\
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \\
  --enable-expert-parallel \\
  --gpu-memory-utilization 0.92

# SGLang >= 0.5.13.post1
python3 -m sglang.launch_server \
  --model-path zai-org/GLM-5.2-FP8 \\
  --tp 8 --context-length 1000000 \\
  --speculative-algorithm EAGLE
```

Fertige quantisierte Checkpoints für andere Stacks: [`nvidia/GLM-5.2-NVFP4`](https://huggingface.co/nvidia/GLM-5.2-NVFP4) für Blackwell, [`cyankiwi/GLM-5.2-AWQ-INT4`](https://huggingface.co/cyankiwi/GLM-5.2-AWQ-INT4) für AWQ-Stacks, [`amd/GLM-5.2-MXFP4`](https://huggingface.co/amd/GLM-5.2-MXFP4) für Instinct.

***

## GPU-Empfehlungen für Clore.ai

| Einrichtung               | Gesamter VRAM | Build                   | Clore.ai-Kosten                           |
| ------------------------- | ------------- | ----------------------- | ----------------------------------------- |
| 8× RTX 5090               | 248GB         | IQ1\_S / IQ2\_M         | \~$2.00–3.50/h                            |
| **10× RTX 5090**          | **310GB**     | **Q2\_K\_XL**           | **\~$5.00/hr**                            |
| 4× RTX PRO 6000 Blackwell | 380GB         | Q2\_K\_XL oder Q3\_K\_M | \~$5.00/hr                                |
| Dedizierte 8× H200        | 1.128 GB      | FP8, voller 1M-Kontext  | [Bare Metal](https://clore.ai/bare-metal) |

Es gibt zu jedem Zeitpunkt nur eine Handvoll Rigs dieser Größe — 47 Server mit ≥242 GB, davon 9 beim letzten Snapshot frei. Prüfe den Marktplatz, bevor du mit einem solchen planst.

***

## Benchmarks

Aus Z.ais eigener Modellkarte (13. Juni 2026). Für die Coding-Benchmarks gibt es unabhängige Reproduktionen; behandle die Reasoning-Zahlen als vom Anbieter gemeldet.

| Benchmark                              | GLM-5.2  | GLM-5.1 | DeepSeek-V4-Pro (Preview) | MiniMax M3 |
| -------------------------------------- | -------- | ------- | ------------------------- | ---------- |
| Terminal-Bench 2.1 (Terminus-2)        | **81.0** | 63.5    | 64                        | 65         |
| Terminal-Bench 2.1 (bestes Test-Setup) | **82.7** | 69      | —                         | —          |
| SWE-bench Pro                          | **62.1** | 58.4    | 55.4                      | 59         |
| NL2Repo                                | **48.9** | 42.7    | 35.5                      | 42.1       |
| DeepSWE                                | **46.2** | 18      | 8                         | 20         |
| HLE                                    | 40.5     | 31      | 37.7                      | 37         |
| AIME 2026                              | 99.2     | 95.3    | 94.6                      | —          |
| GPQA-Diamond                           | 91.2     | 86.2    | 90.1                      | 93         |

***

## Anwendungsfälle

* **Autonome Coding-Agenten** — die Sprünge bei Terminal-Bench und DeepSWE sind genau das Langzeitverhalten, das Agenten brauchen
* **Schlussfolgerungen über ganze Repositories** — 1M-Kontext mit Sparse-Attention, die bei der Länge erschwinglich bleibt
* **Migrations- und Refactor-Arbeiten** — NL2Repo misst den Aufbau eines Repos aus einer Spezifikation, und GLM-5.2 führt im offenen Feld
* **Selbst gehostete Alternative zu geschlossenen Frontier-APIs** — MIT bedeutet, dass du es in einem Produkt ausliefern kannst
* **Batch-Evaluierungs-Frameworks** — miete ein großes Rig minutenweise, führe den Sweep aus, schließe die Bestellung

***

## Fehlerbehebung

| Problem                             | Fix                                                                                                                                  |
| ----------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------ |
| Der Download dauert ewig            | 254 GB bei Q2 — filtere den Marktplatz nach Servern mit hoher Bandbreite und verwende `--include` um nur eine Quantisierung zu laden |
| OOM über mehrere GPUs verteilt      | `--split-mode layer` in llama.cpp; in vLLM erhöhe `--tensor-parallel-size` auf die volle Anzahl der GPUs                             |
| Der erste Token dauert Minuten      | Entferne `--mmap`, behalte das Modell auf lokalem NVMe und wärme es mit einer kurzen Eingabe vor                                     |
| vLLM lehnt die Konfiguration ab     | Benötigt ≥ 0.23.0; SGLang benötigt ≥ 0.5.13.post1                                                                                    |
| Die Qualität wirkt bei IQ1 seltsam  | Es ist ein 1-Bit-Build eines 750B-Modells. Wechsle zu Q2\_K\_XL oder höher, wenn das Rig es zulässt                                  |
| Rig verschwindet mitten im Download | Jemand anderes hat es gemietet. Verwende für längere Einrichtungsarbeiten On-Demand statt Spot                                       |

***

## Nächste Schritte

* **Vorgänger:** [GLM-5.1](/guides/guides_v2-de/sprachmodelle/glm-5-1.md) — die Veröffentlichung von April mit 744B
* **Passt stattdessen auf eine Karte:** [Qwen3.8-27B](/guides/guides_v2-de/sprachmodelle/qwen38-27b.md) — Apache 2.0, 15 GB bei Q4
* **Gleiche Gewichtsklasse:** [MiniMax M3](/guides/guides_v2-de/sprachmodelle/minimax-m3.md) · [Nemotron 3 Ultra](/guides/guides_v2-de/sprachmodelle/nemotron-3-ultra.md) · [DeepSeek V4](/guides/guides_v2-de/sprachmodelle/deepseek-v4.md)
* **Rig-Dimensionierung:** [GPU-Preise & Verfügbarkeit](/guides/guides_v2-de/erste-schritte/pricing.md) · [Multi-GPU-Einrichtung](/guides/guides_v2-de/fortgeschritten/multi-gpu-setup.md)

### Links

* [GLM-5.2 auf Hugging Face](https://huggingface.co/zai-org/GLM-5.2) · [FP8](https://huggingface.co/zai-org/GLM-5.2-FP8) · [GGUF](https://huggingface.co/unsloth/GLM-5.2-GGUF)
* [Z.ai-Blog](https://z.ai/blog/glm-5.2) · [GLM-5 GitHub](https://github.com/zai-org/GLM-5)
* [vLLM-Rezept](https://recipes.vllm.ai/zai-org/GLM-5.2) · [SGLang-Kochbuch](https://cookbook.sglang.io/autoregressive/GLM/GLM-5.2)
* **Eine GPU mieten:** [RTX 5090](https://clore.ai/rent-5090.html) · [Marktplatz](https://clore.ai/marketplace) · [Bare Metal](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-de/sprachmodelle/glm-5-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
