> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md).

# GLM-5.1 (744B MoE, #1 SWE-Bench Pro)

{% hint style="info" %}
**Статус (апрель 2026):** GLM-5.1 был выпущен **7 апреля 2026 года** компанией Z.ai (ранее Zhipu AI) как постепенное, но серьезное обновление [GLM-5](/guides/guides_v2-ru/yazykovye-modeli/glm5.md). Это первая модель с открытыми весами, занявшая первое место в **SWE-Bench Pro (58,4%)**, опередив GPT-5.4 (57,7) и Claude Opus 4.6 (57,3) согласно данным, опубликованным поставщиком. Весы доступны по адресу [huggingface.co/zai-org/GLM-5.1](https://huggingface.co/zai-org/GLM-5.1) под **лицензией MIT**.
{% endhint %}

GLM-5.1 — это **MoE-модель с 744 млрд параметров** языковая модель, которая активирует только **\~40 млрд параметров на токен**. По сравнению со своим предшественником [GLM-5](/guides/guides_v2-ru/yazykovye-modeli/glm5.md), выпуск 5.1 сохраняет ту же MoE-структуру, но поставляется с улучшенной маршрутизацией экспертов, **окно контекста на 200 тыс. токенов**, а **максимальный вывод 131 тыс. токенов**, а обучение было сосредоточено на **долгосрочном агентном кодинге** — модель явно настроена выдерживать тысячи вызовов инструментов и сотни раундов рефакторинга без потери направления.

Для пользователей Clore.ai интересная часть — это **40 млрд активных** число: вам не нужен полноценный кластер 8×H200, чтобы обслуживать ее. Настройка тензорного параллелизма на **2×H100 80GB** (FP8) или **4×A100 80GB** (BF16 с шардингом) этого достаточно для практической пропускной способности — что делает передовой уровень кодинга доступным на [голое железо](https://clore.ai/bare-metal) на маркетплейсе.

### Ключевые характеристики

| Параметр               | Значение                                            |
| ---------------------- | --------------------------------------------------- |
| Общее число параметров | 744 млрд (MoE)                                      |
| Активные параметры     | \~40 млрд за один прямой проход                     |
| Окно контекста         | 200 000 токенов                                     |
| Макс. вывод            | 131 072 токена                                      |
| Лицензия               | MIT                                                 |
| Дата выпуска           | 7 апреля 2026 года                                  |
| Организация            | Z.ai (zai-org на HuggingFace)                       |
| Основные инструменты   | vLLM, SGLang, llama.cpp (GGUF), xLLM, KTransformers |

### Почему GLM-5.1?

* **№1 на SWE-Bench Pro** — 58,4% по заявлению поставщика, впереди GPT-5.4 и Claude Opus 4.6
* **Агенты с длинным горизонтом** — сохраняет оптимизацию на протяжении сотен раундов и тысяч вызовов инструментов
* **Контекст 200K** — достаточно для всей кодовой базы среднего размера плюс набора тестов
* **40 млрд активных MoE** — вы платите за инференс как за плотную модель на 40 млрд, а не на 744 млрд
* **лицензией MIT** — полностью открытые веса, без ограничений на коммерческое использование или дообучение
* **Открытый стек обучения** — Z.ai опубликовала модель, предположительно обученную без дата-центровых GPU Nvidia

***

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

{% hint style="warning" %}
**Все еще большая модель.** Хотя «40 млрд активных» звучит дружелюбно, полные веса 744 млрд нужно загрузить в VRAM (или выгрузить). Веса FP8 — около 860 ГБ; BF16 — около 1,5 ТБ. Планируйте соответственно.
{% endhint %}

| Компонент | Минимум (Q4 GGUF, offload)    | Рекомендуется (FP8)              | Полный BF16    |
| --------- | ----------------------------- | -------------------------------- | -------------- |
| VRAM GPU  | \~80 ГБ (Q4 + выгрузка в RAM) | 2× H100 80 ГБ активных, 8× всего | 8× H200 141 ГБ |
| ОЗУ       | 256 ГБ                        | 256 ГБ                           | 512 ГБ         |
| Диск      | 500 ГБ NVMe                   | 1TB NVMe                         | 2 ТБ NVMe      |
| CUDA      | 12.8+                         | 12.8+                            | 12.8+          |

**Выбор Clore.ai:** Для большинства команд 2× H100 80 ГБ с FP8-чекпойнтом и агрессивной выгрузкой — это оптимальный вариант (\~$2.08/час). Если вам нужна полная пропускная способность BF16, переходите на 8× H200 или используйте API Z.ai для редких запросов.

***

## Вариант A — Ollama / GGUF (квантизированные, сборки сообщества)

{% hint style="warning" %}
**Внимание:** Комьюнити-кванты GGUF обычно появляются через 1–2 недели после релиза Z.ai. Если `ollama pull` не работает, проверьте [huggingface.co/models?search=glm-5.1+gguf](https://huggingface.co/models?search=glm-5.1+gguf) и укажите llama.cpp на файл напрямую.
{% endhint %}

```bash
# Когда будет доступна сборка Q4_K_M
docker exec ollama ollama pull glm-5.1:q4_K_M
docker exec ollama ollama run glm-5.1:q4_K_M

# Или напрямую с llama.cpp на файле GGUF
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/glm-5.1-q4_k_m.gguf \
  --n-gpu-layers 80 --ctx-size 32768 \
  --port 8080 --host 0.0.0.0
```

***

## Вариант B — vLLM (production API, рекомендуется)

vLLM — это основной целевой стек обслуживания Z.ai. Чекпойнт FP8 (`zai-org/GLM-5.1-FP8`) — именно тот, который вам нужен: то же качество, что и у BF16, примерно вдвое меньше памяти.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model zai-org/GLM-5.1-FP8
      --tensor-parallel-size 8
      --max-model-len 65536
      --gpu-memory-utilization 0.88
      --tool-call-parser glm47
      --reasoning-parser glm45
      --enable-auto-tool-choice
      --served-model-name glm-5.1
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Проверить API
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "glm-5.1",
    "messages": [
      {"role": "system", "content": "Вы — старший инженер-программист."},
      {"role": "user", "content": "Рефакторни этот обработчик на Go, чтобы он корректно использовал context.Context, и добавь повторы."}
    ],
    "max_tokens": 4096,
    "temperature": 1.0
  }'
```

{% hint style="info" %}
Используйте `--tensor-parallel-size 2` на 2× H100, если у вас мало GPU, но рассчитывайте на более медленный prefill на контекстах 200K. `--enable-chunked-prefill` очень помогает.
{% endhint %}

***

## Вариант C — SGLang (альтернатива, часто быстрее на Hopper)

```bash
docker pull lmsysorg/sglang:latest

python3 -m sglang.launch_server \
  --model-path zai-org/GLM-5.1-FP8 \
  --tp-size 8 \
  --tool-call-parser glm47 \
  --reasoning-parser glm45 \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --mem-fraction-static 0.88 \
  --context-length 65536 \
  --served-model-name glm-5.1
```

Спекулятивное декодирование EAGLE в SGLang обычно дает прирост пропускной способности в 1,5–2× на длинных завершениях кода.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация   | VRAM     | Ожидаемая производительность                        | Стоимость на Clore.ai                       |
| -------------- | -------- | --------------------------------------------------- | ------------------------------------------- |
| 2× H100 80GB   | 160 ГБ   | FP8 с выгрузкой, \~15–25 ток/с                      | \~$2.08/ч                                   |
| 4× A100 80GB   | 320 ГБ   | BF16 с шардингом, \~20–30 ток/с                     | [голое железо](https://clore.ai/bare-metal) |
| 8× H100 80 ГБ  | 640 ГБ   | FP8 полностью, \~60+ ток/с                          | \~$8.32/ч                                   |
| 8× H200 141 ГБ | 1,128 ГБ | BF16 полностью, максимальная пропускная способность | [голое железо](https://clore.ai/bare-metal) |

{% hint style="success" %}
**Лучшее соотношение цены и качества:** 2× H100 80 ГБ с FP8-чекпойнтом. Вы получаете кодинговую производительность уровня передовой модели примерно по цене подписки Claude Opus — и веса остаются у вас на машине.
{% endhint %}

***

## Сценарии использования

* **Автономные SWE-агенты** — GLM-5.1 явно обучена для долгих циклов вызова инструментов; сочетайте ее с чем-то вроде SWE-agent или OpenHands
* **Понимание кодовой базы** — загрузите в контекст более 100K токенов Go/Rust/Python и попросите архитектурный обзор
* **RAG на длинном контексте** — 200K ctx позволяет за один раз обрабатывать всю продуктовую документацию + обращения в поддержку
* **Пайплайны рефакторинга** — устойчивое сохранение корректности на протяжении сотен правок файлов
* **Оркестрация агент-из-агентов** — используйте GLM-5.1 как планировщик, а меньшие модели (Qwen3.5-35B, GLM-4.7) — как исполнителей

***

## Бенчмарки

{% hint style="warning" %}
**Утверждения вендора — проверяйте независимо.** Ниже приведенные числа взяты из анонса Z.ai от 7 апреля 2026 года. Независимые воспроизведения на SWE-Bench Pro все еще поступают.
{% endhint %}

| Бенчмарк           | GLM-5.1   | GPT-5.4 | Claude Opus 4.6 | GLM-5 |
| ------------------ | --------- | ------- | --------------- | ----- |
| SWE-Bench Pro      | **58.4%** | 57.7%   | 57.3%           | \~52% |
| SWE-Bench Verified | \~79%     | \~78%   | \~80%           | 77.8% |
| HumanEval          | \~94%     | \~95%   | \~94%           | \~93% |
| LiveCodeBench      | \~72%     | \~73%   | \~70%           | \~68% |

***

## Устранение неполадок

| Проблема                               | Решение                                                                                                                   |
| -------------------------------------- | ------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` при загрузке        | FP8-чекпойнту требуется около 860 ГБ VRAM всего. Используйте 8× H100/H200 или перейдите на GGUF Q4 с выгрузкой в RAM.     |
| Медленная загрузка с HuggingFace       | Используйте `huggingface-cli download zai-org/GLM-5.1-FP8 --local-dir ./weights --resume-download`. Ожидайте 800+ ГБ.     |
| Вызовы инструментов тихо отбрасываются | Убедитесь, что `--tool-call-parser glm47` и `--enable-auto-tool-choice` оба задаются в vLLM.                              |
| Пустой режим мышления                  | Требуется `temperature=1.0` — сэмплирование с нулевой температурой ломает трассу рассуждений.                             |
| vLLM отвергает конфигурацию            | GLM-5.1 требует vLLM ≥ 0.7.x (релиз апреля 2026). Используйте `pip install -U vllm --pre` если у вас более старые версии. |
| OOM на контексте 200K                  | Начните с `--max-model-len 65536` и добавьте `--enable-chunked-prefill`; увеличьте после стабилизации.                    |

***

## Дальнейшие шаги

* **Предшественник:** [GLM-5](/guides/guides_v2-ru/yazykovye-modeli/glm5.md) — та же форма MoE, чуть меньше ориентации на кодинг
* **Более дешевая альтернатива:** [Qwen3.5](/guides/guides_v2-ru/yazykovye-modeli/qwen35.md) — плотная модель на 35 млрд помещается на одну RTX 4090
* **Альтернатива для огромного контекста:** [DeepSeek V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md) — контекст 1M, мультимодальная, \~1 трлн параметров
* **Маркетплейс Clore.ai:** [clore.ai/marketplace](https://clore.ai/marketplace) — арендуйте H100/H200/A100 у [голое железо](https://clore.ai/bare-metal)

### Ссылки

* [GLM-5.1 на HuggingFace](https://huggingface.co/zai-org/GLM-5.1)
* [Блог Z.ai — анонс GLM-5.1](https://z.ai/blog/glm-5.1)
* [Платформа Z.ai (hosted API)](https://chat.z.ai)
* [Документация vLLM](https://docs.vllm.ai)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
