> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm-47-flash.md).

# GLM-4.7-Flash

Разверните GLM-4.7-Flash (30B MoE) от Zhipu AI на Clore.ai — эффективную языковую модель с результатом 59.2% на SWE-bench

> GLM-4.7-Flash — это **модель Mixture-of-Experts с 30 млрд параметров** языковая модель от Zhipu AI, которая активирует лишь 3 млрд параметров на токен. Она демонстрирует выдающуюся производительность в задачах программирования и рассуждения, достигая 59,2% на SWE-bench при потреблении всего 10–12 ГБ VRAM для FP16-инференса. Выпущен под **лицензией MIT**, это идеальный выбор для разработчиков, которым нужна качество передовых моделей при доступной стоимости на одной GPU.

## Сводка

* **Размер модели**: 30 млрд всего / 3 млрд активных параметров (MoE)
* **Лицензия**: MIT (полностью коммерческая)
* **Контекст**: 128K токенов
* **Производительность**: 59,2% SWE-bench, 75,4% HumanEval
* **VRAM**: \~10–12 ГБ FP16, \~6 ГБ INT8
* **Скорость**: \~45–60 ток/с на RTX 4090

## Почему GLM-4.7-Flash?

**Эффективная производительность**: GLM-4.7-Flash превосходит ожидания. Несмотря на использование всего 3 млрд активных параметров, он опережает многие плотные модели 70B+ в бенчмарках по коду. Архитектура MoE обеспечивает качество модели 30B при стоимости инференса как у модели 7B.

**Удобен для одной GPU**: В отличие от огромных моделей, требующих многогпузовых конфигураций, GLM-4.7-Flash комфортно работает на одной RTX 4090 или A100 40GB. Это делает его идеальным для разработки, дообучения и экономичных продакшн-развертываний.

**Специалист по коду**: С производительностью 59,2% на SWE-bench GLM-4.7-Flash отлично справляется с задачами программной инженерии — генерацией кода, отладкой, рефакторингом и технической документацией. Он понимает более 20 языков программирования с глубоким учетом контекста.

**Лицензия MIT**: Без ограничений на использование. Развертывайте коммерчески, дообучайте или модифицируйте без лицензионных ограничений. Полные веса и рецепты обучения доступны бесплатно.

## Рекомендации по GPU

| GPU          | VRAM  | Производительность | Ежедневная стоимость\* |
| ------------ | ----- | ------------------ | ---------------------- |
| **RTX 4090** | 24 ГБ | \~50 ток/с         | \~$2.10                |
| **RTX 3090** | 24 ГБ | \~35 ток/с         | \~$1.10                |
| A100 40 ГБ   | 40 ГБ | \~80 ток/с         | \~$3.50                |
| A100 80 ГБ   | 80 ГБ | \~90 ток/с         | \~$4.00                |
| H100         | 80 ГБ | \~120 ток/с        | \~$6.00                |

**Лучшее соотношение цены и качества**: RTX 4090 обеспечивает оптимальное сочетание производительности и стоимости для GLM-4.7-Flash.

\*Оценочные цены на маркетплейсе Clore.ai

## Развертывание с vLLM

### Установите vLLM

```bash
pip install vllm>=0.6.0
# или последнюю версию
pip install git+https://github.com/vllm-project/vllm.git
```

### Настройка на одной GPU

```bash
vllm serve THUDM/glm-4-flash \
  --model THUDM/glm-4-flash \
  --tensor-parallel-size 1 \\
  --dtype float16 \\
  --max-model-len 32768 \
  --served-model-name glm-4.7-flash \
  --trust-remote-code
```

### Обратиться к серверу

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1", 
    api_key="EMPTY"
)

response = client.chat.completions.create(
    model="glm4:7b-chat",
    messages=[
        {"role": "system", "content": "Вы — экспертный Python-разработчик."},
        {"role": "user", "content": "Напишите приложение FastAPI с асинхронным SQLAlchemy и JWT-аутентификацией"}
    ],
    max_tokens=2048,
    temperature=0.7
)

print(response.choices[0].message.content)
```

## Развертывание с SGLang

SGLang часто обеспечивает лучшую пропускную способность для моделей MoE:

```bash
pip install "sglang[all]>=0.3.0"

# Запустить сервер
python -m sglang.launch_server \
  --model-path THUDM/glm-4-flash \
  --port 30000 \
  --host 0.0.0.0 \
  --dtype float16 \\
  --tp-size 1 \
  --context-length 32768
```

## Развертывание с Ollama

Простая настройка для локальной разработки:

```bash
# Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Получить модель (скачает ~18 ГБ)
ollama pull glm4:7b-chat

# Запустить интерактивно
ollama run glm4:7b-chat

# Режим API
ollama serve
```

Затем запросите через REST API:

```python
import requests

response = requests.post('http://localhost:11434/api/generate',
    json={
        'model': 'glm4:7b-chat',
        'prompt': 'Объясните архитектуру MoE в GLM-4.7-Flash',
        'stream': False
    }
)

print(response.json()['response'])
```

## Шаблон Docker

```dockerfile
FROM nvidia/cuda:12.8.1-devel-ubuntu22.04

# Установить Python 3.10
RUN apt-get update && apt-get install -y python3.10 python3-pip curl

# Установить vLLM
RUN pip install vllm>=0.6.0 transformers

# Предзагрузить модель (необязательно)
# RUN python3 -c "from transformers import AutoModel; AutoModel.from_pretrained('THUDM/glm-4-flash', trust_remote_code=True)"

EXPOSE 8000

CMD ["vllm", "serve", "THUDM/glm-4-flash", \
     "--host", "0.0.0.0", \\
     "--port", "8000", \\
     "--tensor-parallel-size", "1", \
     "--dtype", "float16", \\
     "--trust-remote-code"]
```

Сборка и запуск:

```bash
docker build -t glm-4.7-flash .
docker run --gpus all -p 8000:8000 glm-4.7-flash
```

## Пример генерации кода

GLM-4.7-Flash отлично справляется со сложной генерацией кода:

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="glm4:7b-chat",
    messages=[
        {"role": "user", 
         "content": """Создайте класс Python для ограничителя частоты с:
- алгоритмом token bucket
- поддержкой async/await  
- backend на Redis
- декоратором для ограничения частоты вызовов функций
- корректной обработкой ошибок"""}
    ],
    max_tokens=2048,
    temperature=0.3
)

print(response.choices[0].message.content)
```

## Советы для пользователей Clore.ai

* **Оптимизация памяти**: Используйте `--dtype float16` чтобы снизить использование VRAM. Для GPU с 16 ГБ добавьте `--max-model-len 16384` чтобы ограничить контекст.
* **Пакетная обработка**: Увеличьте `--max-num-seqs` для более высокой пропускной способности при обслуживании нескольких запросов.
* **Квантование**: Для RTX 3060/4060 (12 ГБ) используйте квантованные версии AWQ или GPTQ для использования \~6 ГБ VRAM.
* **Прерывание**: GLM-4.7-Flash корректно обрабатывает прерывания — хорошо подходит для прерываемых экземпляров Clore.ai.
* **Длина контекста**: Контекст 128K по умолчанию может быть избыточным. Установите `--max-model-len 32768` для большинства приложений.

## Устранение неполадок

| Проблема                  | Решение                                                                           |
| ------------------------- | --------------------------------------------------------------------------------- |
| `OutOfMemoryError`        | Уменьшите `--max-model-len` или используйте `--dtype float16`                     |
| Медленная загрузка модели | Предварительно закэшируйте с помощью `huggingface-cli download THUDM/glm-4-flash` |
| Ошибки импорта            | Обновите transformers: `pip install transformers>=4.40.0`                         |
| Низкая производительность | Включите Flash Attention: `pip install flash-attn`                                |
| Соединение отклонено      | Проверьте брандмауэр: `ufw allow 8000`                                            |

## Альтернативные модели

Если GLM-4.7-Flash не подходит под ваши задачи:

* **Qwen2.5-Coder-7B**: Лучше для чистого кодинга, меньший объем
* **CodeQwen1.5-7B**: Специалист по коду на китайском и английском
* **GLM-4-9B**: Более крупный собрат с лучшими навыками рассуждения
* **DeepSeek-V3**: MoE-модель 671B для максимальной производительности (несколько GPU)

## Ресурсы

* [GLM-4-Flash на Hugging Face](https://huggingface.co/THUDM/glm-4-flash)
* [Технический отчет GLM-4](https://arxiv.org/abs/2406.12793)
* [Документация vLLM](https://docs.vllm.ai/)
* [GitHub SGLang](https://github.com/sgl-project/sglang)
* [Платформа Zhipu AI](https://open.bigmodel.cn/)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/glm-47-flash.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
