> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm-5-2.md).

# GLM-5.2 (MIT, контекст 1M)

Запустите GLM-5.2, флагманскую кодинговую модель Z.ai с лицензией MIT и контекстом 1M, на мощном много-GPU риге из маркетплейса Clore.ai

{% hint style="info" %}
**Статус (август 2026):** Z.ai выпустила **GLM-5.2** в **13 июня 2026** под **лицензия MIT** — без региональных ограничений и пункта о доходах. Веса: [zai-org/GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) и [zai-org/GLM-5.2-FP8](https://huggingface.co/zai-org/GLM-5.2-FP8). MoE с разреженным вниманием, примерно **750 млрд параметров всего, из них \~40 млрд активных**, а **полноценный контекст на 1 млн токенов**и самые сильные опубликованные open-source результаты в кодинге на данный момент.
{% endhint %}

GLM-5.1 уже была открытой моделью, которую нужно было превзойти в разработке ПО. GLM-5.2 повышает результат Terminal-Bench 2.1 с 63.5 до **81.0** а SWE-bench Pro с 58.4 до **62.1**и делает это под лицензией MIT, в то время как остальная передовая часть рынка перешла к собственным условиям с ограничениями по доходу.

Загвоздка в размере. Контрольная точка FP8 — **756 ГБ**. Это не модель для одной карты и никогда ею не будет. Интересно она на Clore.ai тем, что квантованные сборки укладываются в предел самых больших ригов на рынке.

### Ключевые характеристики

| Параметр             | Значение                                                                                            |
| -------------------- | --------------------------------------------------------------------------------------------------- |
| Параметры            | \~750 млрд всего, \~40 млрд активных (MoE)                                                          |
| Архитектура          | 78 слоёв, 256 маршрутизируемых экспертов, 8 активных на токен, разреженное внимание IndexShare, MTP |
| Контекст             | 1 000 000 токенов                                                                                   |
| Лицензия             | MIT                                                                                                 |
| Дата выпуска         | 13 июня 2026                                                                                        |
| Веса                 | FP8 756 ГБ · Q2\_K\_XL GGUF 254 ГБ · IQ1\_S GGUF 217 ГБ                                             |
| Основные инструменты | SGLang ≥ 0.5.13.post1, vLLM ≥ 0.23.0, llama.cpp                                                     |

### Что нового по сравнению с GLM-5.1

* **Полноценный контекст на 1 млн токенов** — не просто громкий показатель, а окно, которое сохраняется при долгой работе на длинной дистанции
* **IndexShare** — один индексатор, повторно используемый на каждые четыре слоя разреженного внимания, сокращая число FLOPs на токен на **в 2,9× при контексте 1 млн**
* **Улучшенный MTP** — длина принятия при speculative decoding выросла до 20%
* **Гибкая глубина рассуждений** — балансируйте задержку и глубину для каждого запроса
* **Всё ещё MIT** — у весов нет ограничений на использование

***

## Требования

{% hint style="warning" %}
**Этой модели нужен риг, а не карта.** FP8 объёмом 756 ГБ превышает возможности любой машины на маркетплейсе Clore.ai. Самые большие из перечисленных конфигураций — 4× RTX PRO 6000 Blackwell (380 ГБ) и 10–11× RTX 5090 (310–341 ГБ). Здесь подходит только квантованный GGUF; развёртывание в полной точности — для [голое железо](https://clore.ai/bare-metal).
{% endhint %}

| Сборка          | Размер | Где это запускается на Clore.ai                                   |
| --------------- | ------ | ----------------------------------------------------------------- |
| `UD-IQ1_S`      | 217 ГБ | 8× RTX 5090 (248 ГБ) — 47 серверов с ≥242 ГБ                      |
| `UD-IQ2_M`      | 239 ГБ | 8× RTX 5090, впритык                                              |
| `UD-Q2_K_XL`    | 254 ГБ | 10× RTX 5090 (310 ГБ) или 4× RTX PRO 6000 (380 ГБ)                |
| `UD-Q3_K_M`     | 343 ГБ | только 4× RTX PRO 6000 (380 ГБ) — указано 2 таких сервера         |
| `UD-IQ4_XS`     | 365 ГБ | 4× RTX PRO 6000, без запаса                                       |
| Официальный FP8 | 756 ГБ | Нет на маркетплейсе → [голое железо](https://clore.ai/bare-metal) |

Добавьте 10–15% к размеру весов для KV-кэша и активаций при рабочих длинах контекста, и проверьте системную RAM: этим ригам нужно достаточно памяти, чтобы разместить веса во время загрузки.

***

## Развёртывание с llama.cpp на многo-GPU риге

Реалистичный путь на железе маркетплейса. Арендуйте риг с 10× RTX 5090 (примерно **5,00 $/ч** на момент последнего снимка) и распределите модель по всем картам:

```bash
# ~254 ГБ — оставьте ригу некоторый запас
huggingface-cli download unsloth/GLM-5.2-GGUF \\
  --include "*UD-Q2_K_XL*" --local-dir /workspace/glm52

llama-server -m /workspace/glm52/*UD-Q2_K_XL*-00001-of-*.gguf \\
  --host 0.0.0.0 --port 8080 \\
  -ngl 999 --split-mode layer \\
  -c 131072 --flash-attn \\
  --no-mmap
```

{% hint style="info" %}
`--no-mmap` важно на арендованном железе: веса загружаются на диск, который вам не принадлежит, и mmap-ирование файла на 254 ГБ через медленный диск превращает задержку до первого токена в минуты. Закладывайте 30–60 минут только на загрузку и выбирайте сервер с быстрым каналом.
{% endhint %}

## Развёртывание с vLLM или SGLang (FP8, выделенное железо)

Если у вас есть ресурсы — bare metal или собственный кластер — Z.ai напрямую поддерживает оба движка:

```bash
# vLLM >= 0.23.0
vllm serve zai-org/GLM-5.2-FP8 \\
  --tensor-parallel-size 8 \
  --max-model-len 1000000 \\
  --enable-expert-parallel \\
  --gpu-memory-utilization 0.92

# SGLang >= 0.5.13.post1
python3 -m sglang.launch_server \
  --model-path zai-org/GLM-5.2-FP8 \\
  --tp 8 --context-length 1000000 \\
  --speculative-algorithm EAGLE
```

Готовые квантованные контрольные точки для других стеков: [`nvidia/GLM-5.2-NVFP4`](https://huggingface.co/nvidia/GLM-5.2-NVFP4) для Blackwell, [`cyankiwi/GLM-5.2-AWQ-INT4`](https://huggingface.co/cyankiwi/GLM-5.2-AWQ-INT4) для стеков AWQ, [`amd/GLM-5.2-MXFP4`](https://huggingface.co/amd/GLM-5.2-MXFP4) для Instinct.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация              | Общий объём VRAM | Сборка                             | Стоимость Clore.ai                          |
| ------------------------- | ---------------- | ---------------------------------- | ------------------------------------------- |
| 8× RTX 5090               | 248 ГБ           | IQ1\_S / IQ2\_M                    | \~2,00–3,50 $/ч                             |
| **10× RTX 5090**          | **310 ГБ**       | **Q2\_K\_XL**                      | **\~$5.00/ч**                               |
| 4× RTX PRO 6000 Blackwell | 380 ГБ           | Q2\_K\_XL или Q3\_K\_M             | \~$5.00/ч                                   |
| Выделенный 8× H200        | 1,128 ГБ         | FP8, полный контекст 1 млн токенов | [голое железо](https://clore.ai/bare-metal) |

В любой момент существует лишь несколько таких ригов — 47 серверов с ≥242 ГБ, 9 из них были свободны на момент последнего снимка. Проверьте маркетплейс, прежде чем рассчитывать на такой вариант.

***

## Бенчмарки

Из собственной карточки модели Z.ai (13 июня 2026). Для наборов по кодингу есть независимые воспроизведения; показатели по рассуждению следует считать данными от производителя.

| Бенчмарк                            | GLM-5.2  | GLM-5.1 | DeepSeek-V4-Pro (предварительная версия) | MiniMax M3 |
| ----------------------------------- | -------- | ------- | ---------------------------------------- | ---------- |
| Terminal-Bench 2.1 (Terminus-2)     | **81.0** | 63.5    | 64                                       | 65         |
| Terminal-Bench 2.1 (лучшая обвязка) | **82.7** | 69      | —                                        | —          |
| SWE-bench Pro                       | **62.1** | 58.4    | 55.4                                     | 59         |
| NL2Repo                             | **48.9** | 42.7    | 35.5                                     | 42.1       |
| DeepSWE                             | **46.2** | 18      | 8                                        | 20         |
| HLE                                 | 40.5     | 31      | 37.7                                     | 37         |
| AIME 2026                           | 99.2     | 95.3    | 94.6                                     | —          |
| GPQA-Diamond                        | 91.2     | 86.2    | 90.1                                     | 93         |

***

## Сценарии использования

* **Автономные агенты для программирования** — скачки в Terminal-Bench и DeepSWE — это именно то долгосрочное поведение, которое нужно агентам
* **Рассуждение по всему репозиторию** — контекст на 1 млн токенов с разреженным вниманием, который остаётся доступным по цене на большой длине
* **Миграция и рефакторинг** — NL2Repo измеряет создание репозитория по спецификации, и GLM-5.2 лидирует среди открытых моделей
* **Самостоятельно размещаемая альтернатива закрытым API передовых моделей** — MIT означает, что вы можете встроить её в продукт
* **Пакетные обвязки для оценки** — арендуйте большой риг поминутно, запустите прогон и закройте заказ

***

## Устранение неполадок

| Проблема                              | Исправьте                                                                                                                                       |
| ------------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------- |
| Загрузка занимает вечность            | 254 ГБ на Q2 — отфильтруйте маркетплейс по серверам с высокой пропускной способностью и используйте `--include` чтобы скачать только один квант |
| Нехватка памяти распределяется по GPU | `--split-mode layer` в llama.cpp; в vLLM увеличьте `--tensor-parallel-size` до полного числа GPU                                                |
| Первый токен обрабатывается минутами  | Уберите `--mmap`, держите модель на локальном NVMe и прогрейте её коротким запросом                                                             |
| vLLM отвергает конфигурацию           | Требуется ≥ 0.23.0; для SGLang требуется ≥ 0.5.13.post1                                                                                         |
| Качество кажется странным на IQ1      | Это 1-битная сборка 750-миллиардной модели. Переходите на Q2\_K\_XL или выше, если риг позволяет                                                |
| Риг исчезает посреди загрузки         | Его арендовал кто-то другой. Для долгой настройки используйте on-demand, а не spot                                                              |

***

## Дальнейшие шаги

* **Предшественник:** [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — апрельский релиз на 744 млрд параметров
* **Вместо этого помещается на одной карте:** [Qwen3.8-27B](/guides/guides_v2-ru/yazykovye-modeli/qwen38-27b.md) — Apache 2.0, 15 ГБ при Q4
* **Та же категория по размеру:** [MiniMax M3](/guides/guides_v2-ru/yazykovye-modeli/minimax-m3.md) · [Nemotron 3 Ultra](/guides/guides_v2-ru/yazykovye-modeli/nemotron-3-ultra.md) · [DeepSeek V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md)
* **Подбор конфигурации:** [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) · [Настройка нескольких GPU](/guides/guides_v2-ru/prodvinutyi/multi-gpu-setup.md)

### Ссылки

* [GLM-5.2 на Hugging Face](https://huggingface.co/zai-org/GLM-5.2) · [FP8](https://huggingface.co/zai-org/GLM-5.2-FP8) · [GGUF](https://huggingface.co/unsloth/GLM-5.2-GGUF)
* [Блог Z.ai](https://z.ai/blog/glm-5.2) · [GitHub GLM-5](https://github.com/zai-org/GLM-5)
* [рецепт vLLM](https://recipes.vllm.ai/zai-org/GLM-5.2) · [Руководство SGLang](https://cookbook.sglang.io/autoregressive/GLM/GLM-5.2)
* **Арендовать GPU:** [RTX 5090](https://clore.ai/rent-5090.html) · [Маркетплейс](https://clore.ai/marketplace) · [Выделенное железо](https://clore.ai/bare-metal)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm-5-2.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
