> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/language-models/glm-5-2.md).

# GLM-5.2 (MIT, 1M संदर्भ)

Clore.ai मार्केटप्लेस से एक बड़े मल्टी-GPU रिग पर GLM-5.2 चलाएँ, जो Z.ai का MIT-लाइसेंस वाला 1M-कॉन्टेक्स्ट कोडिंग फ्लैगशिप है

{% hint style="info" %}
**स्थिति (अगस्त 2026):** Z.ai ने जारी किया **GLM-5.2** को **13 जून 2026** के अंतर्गत **MIT लाइसेंस** — कोई क्षेत्रीय सीमा नहीं, कोई राजस्व-शर्त नहीं। वज़न: [zai-org/GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) और [zai-org/GLM-5.2-FP8](https://huggingface.co/zai-org/GLM-5.2-FP8). स्पार्स-अटेंशन MoE, लगभग **कुल \~750B पैरामीटर, जिनमें \~40B सक्रिय**, एक **मज़बूत 1M-टोकन संदर्भ**, और अब तक प्रकाशित सबसे मजबूत ओपन कोडिंग स्कोर।
{% endhint %}

GLM-5.1 पहले ही सॉफ्टवेयर इंजीनियरिंग में मात देने वाला ओपन मॉडल था। GLM-5.2 Terminal-Bench 2.1 को 63.5 से बढ़ाकर **81.0** और SWE-bench Pro को 58.4 से बढ़ाकर **62.1**, और यह MIT लाइसेंस के साथ करता है, जबकि बाकी फ्रंटियर कस्टम शर्तों और राजस्व-गेट्स की ओर बढ़ गया।

समस्या इसका आकार है। FP8 चेकपॉइंट **756GB**है। यह एक-सिंगल-कार्ड मॉडल नहीं है और कभी नहीं होगा। Clore.ai पर इसे दिलचस्प बनाने वाली बात यह है कि क्वांटाइज़्ड बिल्ड्स बाज़ार में सबसे बड़े रिग्स की सीमा के भीतर आ जाती हैं।

### मुख्य विनिर्देश

| गुण          | मान                                                                                    |
| ------------ | -------------------------------------------------------------------------------------- |
| पैरामीटर     | \~750B कुल, \~40B सक्रिय (MoE)                                                         |
| आर्किटेक्चर  | 78 परतें, 256 रूट किए गए विशेषज्ञ, टोकन प्रति 8 सक्रिय, IndexShare स्पार्स-अटेंशन, MTP |
| संदर्भ       | 1,000,000 टोकन                                                                         |
| लाइसेंस      | MIT                                                                                    |
| रिलीज़ तिथि  | 13 जून 2026                                                                            |
| वज़न         | FP8 756GB · Q2\_K\_XL GGUF 254GB · IQ1\_S GGUF 217GB                                   |
| मुख्य टूलिंग | SGLang ≥ 0.5.13.post1, vLLM ≥ 0.23.0, llama.cpp                                        |

### GLM-5.1 की तुलना में नया क्या है

* **मज़बूत 1M संदर्भ** — कोई सुर्ख़ियों वाला आंकड़ा नहीं, बल्कि ऐसा दायरा जो लंबे-क्षितिज के काम में भी टिकता है
* **IndexShare** — हर चार स्पार्स-अटेंशन परतों में एक ही इंडेक्सर का पुनः उपयोग, जिससे प्रति-टोकन FLOPs में कमी आती है **1M संदर्भ पर 2.9×**
* **बेहतर MTP** — speculative-decoding acceptance length में अधिकतम 20% की बढ़ोतरी
* **लचीला चिंतन-प्रयास** — विलंबता और प्रति अनुरोध गहराई के बीच संतुलन
* **फिर भी MIT** — वज़नों पर कोई उपयोग-प्रतिबंध नहीं है

***

## आवश्यकताएँ

{% hint style="warning" %}
**इस मॉडल को रिग चाहिए, कार्ड नहीं।** 756GB का FP8 Clore.ai मार्केटप्लेस की हर मशीन से बड़ा है। सबसे बड़े सूचीबद्ध बॉक्स 4× RTX PRO 6000 Blackwell (380GB) और 10–11× RTX 5090 (310–341GB) हैं। यहाँ केवल क्वांटाइज़्ड GGUF ही रास्ता है; पूर्ण-परिशुद्धता सर्विंग के लिए [bare metal](https://clore.ai/bare-metal).
{% endhint %}

| बिल्ड        | आकार  | Clore.ai पर यह कहाँ चलता है                                      |
| ------------ | ----- | ---------------------------------------------------------------- |
| `UD-IQ1_S`   | 217GB | 8× RTX 5090 (248GB) — ≥242GB पर 47 सर्वर सूचीबद्ध हैं            |
| `UD-IQ2_M`   | 239GB | 8× RTX 5090, बहुत कसा हुआ                                        |
| `UD-Q2_K_XL` | 254GB | 10× RTX 5090 (310GB) या 4× RTX PRO 6000 (380GB)                  |
| `UD-Q3_K_M`  | 343GB | केवल 4× RTX PRO 6000 (380GB) — ऐसे 2 सर्वर सूचीबद्ध हैं          |
| `UD-IQ4_XS`  | 365GB | 4× RTX PRO 6000, कोई अतिरिक्त जगह नहीं                           |
| आधिकारिक FP8 | 756GB | मार्केटप्लेस पर नहीं → [bare metal](https://clore.ai/bare-metal) |

कार्यशील संदर्भ लंबाइयों पर KV कैश और activations के लिए वज़न आकार के ऊपर 10–15% जोड़ें, और सिस्टम RAM जाँचें: लोड के दौरान वज़नों को स्टेज करने के लिए इन रिग्स को पर्याप्त RAM चाहिए।

***

## मल्टी-GPU रिग पर llama.cpp के साथ डिप्लॉय करें

मार्केटप्लेस हार्डवेयर पर यथार्थवादी रास्ता। 10× RTX 5090 रिग किराए पर लें (लगभग **$5.00/hr** पिछले स्नैपशॉट में) और मॉडल को सभी कार्डों में बाँट दें:

```bash
# ~254GB — रिग में कुछ अतिरिक्त जगह छोड़ें
huggingface-cli download unsloth/GLM-5.2-GGUF \
  --include "*UD-Q2_K_XL*" --local-dir /workspace/glm52

llama-server -m /workspace/glm52/*UD-Q2_K_XL*-00001-of-*.gguf \
  --host 0.0.0.0 --port 8080 \
  -ngl 999 --split-mode layer \
  -c 131072 --flash-attn \
  --no-mmap
```

{% hint style="info" %}
`--no-mmap` किराए के हार्डवेयर पर यह मायने रखता है: वज़न एक ऐसे डिस्क पर नए सिरे से खींचे जाते हैं जिसे आप अपने पास नहीं रखते, और धीमी डिस्क पर 254GB फ़ाइल का mmap करना पहले टोकन की विलंबता को मिनटों में बदल देता है। डाउनलोड के लिए ही 30–60 मिनट का बजट रखें और तेज़ लिंक वाला सर्वर चुनें।
{% endhint %}

## vLLM या SGLang के साथ डिप्लॉय करें (FP8, समर्पित हार्डवेयर)

अगर आपके पास क्षमता है — बेयर मेटल, या अपना क्लस्टर — Z.ai दोनों इंजनों को सीधे सपोर्ट करता है:

```bash
# vLLM >= 0.23.0
vllm serve zai-org/GLM-5.2-FP8 \
  --tensor-parallel-size 8 \\
  --max-model-len 1000000 \
  --enable-expert-parallel \
  --gpu-memory-utilization 0.92

# SGLang >= 0.5.13.post1
python3 -m sglang.launch_server \\
  --model-path zai-org/GLM-5.2-FP8 \
  --tp 8 --context-length 1000000 \
  --speculative-algorithm EAGLE
```

अन्य स्टैक्स के लिए तैयार-शुदा क्वांटाइज़्ड चेकपॉइंट: [`nvidia/GLM-5.2-NVFP4`](https://huggingface.co/nvidia/GLM-5.2-NVFP4) Blackwell के लिए, [`cyankiwi/GLM-5.2-AWQ-INT4`](https://huggingface.co/cyankiwi/GLM-5.2-AWQ-INT4) AWQ स्टैक्स के लिए, [`amd/GLM-5.2-MXFP4`](https://huggingface.co/amd/GLM-5.2-MXFP4) Instinct के लिए।

***

## Clore.ai GPU अनुशंसाएँ

| सेटअप                     | कुल VRAM  | बिल्ड                 | Clore.ai लागत                             |
| ------------------------- | --------- | --------------------- | ----------------------------------------- |
| 8× RTX 5090               | 248GB     | IQ1\_S / IQ2\_M       | \~$2.00–3.50/घंटा                         |
| **10× RTX 5090**          | **310GB** | **Q2\_K\_XL**         | **\~$5.00/घंटा**                          |
| 4× RTX PRO 6000 Blackwell | 380GB     | Q2\_K\_XL या Q3\_K\_M | \~$5.00/घंटा                              |
| समर्पित 8× H200           | 1,128GB   | FP8, पूरा 1M संदर्भ   | [bare metal](https://clore.ai/bare-metal) |

इस आकार के बस कुछ ही रिग किसी भी समय मौजूद होते हैं — ≥242GB पर 47 सर्वर, जिनमें से 9 आख़िरी स्नैपशॉट में मुफ़्त थे। किसी एक पर योजना बनाने से पहले मार्केटप्लेस जाँचें।

***

## बेंचमार्क

Z.ai के अपने मॉडल कार्ड से (13 जून 2026)। कोडिंग सुइट्स के लिए स्वतंत्र पुनरुत्पादन मौजूद हैं; तर्क संबंधी संख्याओं को विक्रेता-रिपोर्टेड मानें।

| Benchmark                              | GLM-5.2  | GLM-5.1 | DeepSeek-V4-Pro (Preview) | MiniMax M3 |
| -------------------------------------- | -------- | ------- | ------------------------- | ---------- |
| Terminal-Bench 2.1 (Terminus-2)        | **81.0** | 63.5    | 64                        | 65         |
| Terminal-Bench 2.1 (सर्वोत्तम हार्नेस) | **82.7** | 69      | —                         | —          |
| SWE-bench Pro                          | **62.1** | 58.4    | 55.4                      | 59         |
| NL2Repo                                | **48.9** | 42.7    | 35.5                      | 42.1       |
| DeepSWE                                | **46.2** | 18      | 8                         | 20         |
| HLE                                    | 40.5     | 31      | 37.7                      | 37         |
| AIME 2026                              | 99.2     | 95.3    | 94.6                      | —          |
| GPQA-Diamond                           | 91.2     | 86.2    | 90.1                      | 93         |

***

## उपयोग के मामले

* **स्वायत्त कोडिंग एजेंट** — Terminal-Bench और DeepSWE में छलांगें बिल्कुल वही दीर्घकालिक व्यवहार हैं जिनकी एजेंटों को ज़रूरत होती है
* **पूरे रिपॉजिटरी पर तर्क** — 1M संदर्भ, स्पार्स-अटेंशन के साथ जो लंबाई बढ़ने पर भी किफायती रहता है
* **माइग्रेशन और रिफैक्टर कार्य** — NL2Repo एक स्पेक से रिपॉजिटरी बनाने को मापता है, और GLM-5.2 खुले क्षेत्र में आगे है
* **बंद फ्रंटियर APIs का स्व-होस्टेड विकल्प** — MIT का मतलब है कि आप इसे किसी उत्पाद के भीतर शिप कर सकते हैं
* **बैच मूल्यांकन हार्नेस** — एक बड़े रिग को मिनट के हिसाब से किराए पर लें, स्वीप चलाएँ, ऑर्डर बंद करें

***

## समस्या निवारण

| समस्या                                 | ठीक करें                                                                                                                 |
| -------------------------------------- | ------------------------------------------------------------------------------------------------------------------------ |
| डाउनलोड में बहुत समय लगता है           | Q2 पर 254GB — उच्च-बैंडविड्थ सर्वरों के लिए मार्केटप्लेस फ़िल्टर करें और उपयोग करें `--include` एक ही क्वांट लेने के लिए |
| GPU में बाँटकर OOM                     | `--split-mode layer` llama.cpp में; vLLM में बढ़ाएँ `--tensor-parallel-size` को GPU की पूरी संख्या तक                    |
| पहला टोकन मिनट लेता है                 | हटा दें `--mmap`, मॉडल को स्थानीय NVMe पर रखें, और छोटे प्रॉम्प्ट से पहले से गर्म करें                                   |
| vLLM कॉन्फ़िगरेशन अस्वीकार करता है     | ≥ 0.23.0 चाहिए; SGLang को ≥ 0.5.13.post1 चाहिए                                                                           |
| IQ1 पर गुणवत्ता ठीक नहीं लगती          | यह 750B मॉडल का 1-bit बिल्ड है। अगर रिग अनुमति दे तो Q2\_K\_XL या उससे ऊपर जाएँ                                          |
| डाउनलोड के बीच में रिग गायब हो जाता है | किसी और ने इसे किराए पर ले लिया। लंबे सेटअप काम के लिए spot की बजाय on-demand का उपयोग करें                              |

***

## अगले चरण

* **पूर्ववर्ती:** [GLM-5.1](/guides/guides_v2-hi/language-models/glm-5-1.md) — अप्रैल की 744B रिलीज़
* **इसके बजाय एक ही कार्ड पर फिट होता है:** [Qwen3.8-27B](/guides/guides_v2-hi/language-models/qwen38-27b.md) — Apache 2.0, Q4 पर 15GB
* **उसी वज़न वर्ग में:** [MiniMax M3](/guides/guides_v2-hi/language-models/minimax-m3.md) · [Nemotron 3 Ultra](/guides/guides_v2-hi/language-models/nemotron-3-ultra.md) · [DeepSeek V4](/guides/guides_v2-hi/language-models/deepseek-v4.md)
* **रिग आकार निर्धारण:** [GPU मूल्य और उपलब्धता](/guides/guides_v2-hi/getting-started/pricing.md) · [मल्टी-GPU सेटअप](/guides/guides_v2-hi/advanced/multi-gpu-setup.md)

### लिंक्स

* [Hugging Face पर GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) · [FP8](https://huggingface.co/zai-org/GLM-5.2-FP8) · [GGUF](https://huggingface.co/unsloth/GLM-5.2-GGUF)
* [Z.ai ब्लॉग](https://z.ai/blog/glm-5.2) · [GLM-5 GitHub](https://github.com/zai-org/GLM-5)
* [vLLM रेसिपी](https://recipes.vllm.ai/zai-org/GLM-5.2) · [SGLang कुकबुक](https://cookbook.sglang.io/autoregressive/GLM/GLM-5.2)
* **GPU किराये पर लें:** [RTX 5090](https://clore.ai/rent-5090.html) · [मार्केटप्लेस](https://clore.ai/marketplace) · [बेयर मेटल](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/language-models/glm-5-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
