> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm5.md).

# GLM-5

Разверните GLM-5 (744B MoE) от Zhipu AI на Clore.ai — доступ к API и самостоятельный хостинг с vLLM

GLM-5, выпущенная в феврале 2026 года компанией Zhipu AI (Z.AI), — это **MoE-модель с 744 млрд параметров** языковая модель, которая активирует только 40 млрд параметров на токен. Она достигает лучшей в своём классе производительности среди open-source моделей в задачах рассуждения, программирования и агентных задач — набирая 77,8% на SWE-bench Verified и соперничая с передовыми моделями, такими как Claude Opus 4.5 и GPT-5.2. Модель доступна под **лицензией MIT** на HuggingFace.

## Ключевые особенности

* **744B всего / 40B активно** — MoE с 256 экспертами и высокоэффективной маршрутизацией
* **Передовая производительность в кодинге** — 77,8% SWE-bench Verified, 73,3% SWE-bench Multilingual
* **Глубокое рассуждение** — 92,7% на AIME 2026, 96,9% на HMMT Nov 2025, встроенный режим размышления
* **Агентные возможности** — нативный вызов инструментов, выполнение функций и планирование долгосрочных задач
* **Окно контекста 200K+** — обрабатывает огромные кодовые базы и длинные документы
* **лицензией MIT** — полностью открытые веса, коммерческое использование разрешено

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

Самостоятельный хостинг GLM-5 — серьёзная задача: FP8-чекпойнт требует **\~860 ГБ VRAM**.

| Компонент | Минимум (FP8) | Рекомендуется  |
| --------- | ------------- | -------------- |
| GPU       | 8× H100 80 ГБ | 8× H200 141 ГБ |
| VRAM      | 640 ГБ        | 1,128 ГБ       |
| ОЗУ       | 256 ГБ        | 512 ГБ         |
| Диск      | 1,5 ТБ NVMe   | 2 ТБ NVMe      |
| CUDA      | 12.8+         | 12.8+          |

**Рекомендация Clore.ai**: Для большинства пользователей, **доступ к GLM-5 через API** (Z.AI, OpenRouter). Самостоятельный хостинг имеет смысл только если вы можете арендовать 8× H100/H200 ([голое железо](https://clore.ai/bare-metal) на Clore.ai).

## Доступ к API (рекомендуется большинству пользователей)

Самый практичный способ использовать GLM-5 с машины Clore.ai или где угодно:

### Через платформу Z.AI

```python
from openai import OpenAI

client = OpenAI(
    api_key="your-zai-api-key",
    base_url="https://api.z.ai/v1"
)

response = client.chat.completions.create(
    model="glm-5",
    messages=[
        {"role": "system", "content": "Вы — полезный помощник."},
        {"role": "user", "content": "Напиши асинхронный веб-скрейпер на Python с использованием aiohttp и BeautifulSoup"}
    ],
    temperature=1.0,
    max_tokens=4096
)
print(response.choices[0].message.content)
```

### Через OpenRouter

```python
from openai import OpenAI

client = OpenAI(
    api_key="your-openrouter-key",
    base_url="https://openrouter.ai/api/v1"
)

response = client.chat.completions.create(
    model="zai-org/glm-5",
    messages=[
        {"role": "user", "content": "Объясни архитектуру MoE, используемую в GLM-5"}
    ],
    max_tokens=2048
)
print(response.choices[0].message.content)
```

## Настройка vLLM (самостоятельный хостинг)

Для тех, у кого есть доступ к высокопроизводительным многопроцессорным GPU-машинам на Clore.ai:

```bash
# Установите vLLM (для поддержки GLM-5 требуется nightly-версия)
pip install -U vllm --pre --extra-index-url https://wheels.vllm.ai/nightly

# Установите последние transformers (обязательно)
pip install git+https://github.com/huggingface/transformers.git
```

### Запустить FP8 на 8× H200 GPU

```bash
vllm serve zai-org/GLM-5-FP8 \
  --tensor-parallel-size 8 \
  --speculative-config.method mtp \
  --speculative-config.num_speculative_tokens 1 \
  --tool-call-parser glm47 \
  --reasoning-parser glm45 \
  --enable-auto-tool-choice \
  --served-model-name glm-5-fp8 \
  --gpu-memory-utilization 0.85
```

### Обратиться к серверу

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

# С режимом размышления (по умолчанию)
response = client.chat.completions.create(
    model="glm-5-fp8",
    messages=[
        {"role": "system", "content": "Вы — полезный помощник."},
        {"role": "user", "content": "Реши: найди все простые p, для которых p^2 + 2 тоже простое"}
    ],
    temperature=1.0,
    max_tokens=4096
)
print(response.choices[0].message.content)

# Без режима размышления (быстрее, более короткие ответы)
response = client.chat.completions.create(
    model="glm-5-fp8",
    messages=[
        {"role": "user", "content": "Напиши быструю сортировку на Rust"}
    ],
    temperature=1.0,
    max_tokens=4096,
    extra_body={
        "chat_template_kwargs": {"enable_thinking": False}
    }
)
print(response.choices[0].message.content)
```

## Альтернатива SGLang

SGLang также поддерживает GLM-5 и может обеспечить лучшую производительность на некотором оборудовании:

```bash
# Использование Docker (GPU Hopper)
docker pull lmsysorg/sglang:glm5-hopper

# Запустить сервер
python3 -m sglang.launch_server \
  --model-path zai-org/GLM-5-FP8 \
  --tp-size 8 \
  --tool-call-parser glm47 \
  --reasoning-parser glm45 \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --mem-fraction-static 0.85 \
  --served-model-name glm-5-fp8
```

## Быстрый старт с Docker

```bash
# Docker-образ vLLM с поддержкой GLM-5
docker run --gpus all -p 8000:8000 \
  --ipc=host \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:glm5 zai-org/GLM-5-FP8 \
  --tensor-parallel-size 8 \
  --tool-call-parser glm47 \
  --reasoning-parser glm45 \
  --enable-auto-tool-choice \
  --served-model-name glm5 \
  --trust-remote-code
```

## Пример вызова инструментов

GLM-5 имеет нативную поддержку вызова инструментов — идеально для создания агентных приложений:

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

tools = [{
    "type": "function",
    "function": {
        "name": "get_weather",
        "description": "Получить текущую погоду для города",
        "parameters": {
            "type": "object",
            "required": ["city"],
            "properties": {
                "city": {"type": "string", "description": "Название города"}
            }
        }
    }
}]

response = client.chat.completions.create(
    model="glm-5-fp8",
    messages=[{"role": "user", "content": "Какая сейчас погода в Токио?"}],
    tools=tools,
    tool_choice="auto"
)
print(response.choices[0].message.tool_calls)
```

## Советы для пользователей Clore.ai

* **Сначала API, потом самостоятельный хостинг**: GLM-5 требует 8× H200 ([голое железо](https://clore.ai/bare-metal) на Clore.ai). Для эпизодического использования API Z.AI или OpenRouter значительно выгоднее. Самостоятельный хостинг имеет смысл только если вам нужна постоянная пропускная способность или конфиденциальность данных.
* **Рассмотрите вместо этого GLM-4.7**: Если 8× H200 — это слишком, предшественник GLM-4.7 (355B, 32B активных) работает на 4× H200 или 4× H100 (\~$4.16/час) и всё ещё обеспечивает отличную производительность.
* **Используйте веса FP8**: Всегда используйте `zai-org/GLM-5-FP8` — такое же качество, как у BF16, но почти вдвое меньшее потребление памяти. Версия BF16 требует 16× GPU.
* **Следите за использованием VRAM**: `watch nvidia-smi` — запросы с длинным контекстом могут резко увеличить расход памяти. Оставьте запас, установив `--gpu-memory-utilization 0.85` для запаса по памяти.
* **Компромисс режима размышления**: Режим размышления даёт лучшие результаты на сложных задачах, но использует больше токенов и времени. Отключайте его для простых запросов с `enable_thinking: false`.

## Устранение неполадок

| Проблема                        | Решение                                                                                          |
| ------------------------------- | ------------------------------------------------------------------------------------------------ |
| `OutOfMemoryError` при запуске  | Убедитесь, что у вас есть 8× H200 (по 141 ГБ каждая). Для FP8 требуется около 860 ГБ общей VRAM. |
| Медленные загрузки (\~800 ГБ)   | Используйте `huggingface-cli download zai-org/GLM-5-FP8` с `--local-dir` чтобы возобновить.      |
| Несовместимость версии vLLM     | GLM-5 требует nightly-версию vLLM. Установите через `pip install -U vllm --pre`.                 |
| Вызовы инструментов не работают | Добавьте `--tool-call-parser glm47 --enable-auto-tool-choice` в команду запуска сервера.         |
| Ошибки DeepGEMM                 | Установите DeepGEMM для FP8: используйте `install_deepgemm.sh` скрипт из репозитория vLLM.       |
| Пустой вывод режима размышления | Установите `temperature=1.0` — режим размышления требует ненулевой температуры.                  |

## Дополнительное чтение

* [GLM-5 на HuggingFace](https://huggingface.co/zai-org/GLM-5)
* [FP8-чекпойнт GLM-5](https://huggingface.co/zai-org/GLM-5-FP8)
* [Платформа Z.AI](https://chat.z.ai)
* [Документация Z.AI API](https://docs.z.ai/guides/llm/glm-5)
* [Рецепт GLM-5 для vLLM](https://docs.vllm.ai/projects/recipes/en/latest/GLM/GLM5.html)
* [Технический блог о GLM-5](https://z.ai/blog/glm-5)
* [Инфраструктура Slime RL](https://github.com/THUDM/slime)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
