> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/gemma4.md).

# Gemma 4 (26B MoE, 4B активных)

{% hint style="info" %}
**Статус (апрель 2026):** Gemma 4 была выпущена **2 апреля 2026 года** Google как следующее поколение семейства открытых весов Gemma. Поставляются две версии:  **плотная 31B** (`google/gemma-4-31b-it`) и  **26B MoE с \~4B активными параметрами** (`google/gemma-4-26b-it`). Обе опубликованы под стандартными **условиями использования Gemma** на [huggingface.co/google/gemma-4-26b-it](https://huggingface.co/google/gemma-4-26b-it) и [huggingface.co/google/gemma-4-31b-it](https://huggingface.co/google/gemma-4-31b-it).
{% endhint %}

Gemma 4 — первая MoE-модель Google в линейке Gemma и первый релиз Gemma, поднявшийся в верхнюю часть LMSYS Arena (по данным производителя **№3 в общем зачёте на момент релиза**, опередив несколько закрытых моделей по фактичности и следованию инструкциям). Главная цифра — у MoE-варианта: **26B параметров всего, \~4B активных на токен**, что даёт почти передовой уровень следования инструкциям при стоимости инференса, как у небольшой плотной модели.

Для пользователей Clore.ai практический вывод прост — 26B MoE уверенно работает на одной **RTX 4090 (24 ГБ)** с FP8 или 4-битной квантизацией (\~10 ток/с) и обеспечивает производственный уровень пропускной способности на одной **H100 80GB** (\~40+ ток/с), делая следование инструкциям уровня Gemma доступным примерно за \~$1.04/ч на маркетплейсе. 31B плотная версия — более способный, но и более дорогой вариант; для сервинга требуется 2× RTX 4090 или 1× H100.

## Ключевые особенности

* **Архитектура MoE (вариант 26B)** — 26B параметров всего, \~4B активируются на токен; платите стоимость инференса уровня 4B за качество уровня 26B
* **Плотная альтернатива (вариант 31B)** — для команд, которым важны предсказуемость и зрелость инструментов плотного инференса
* **Контекстное окно 128K** — вопросы и ответы по длинным документам, RAG по средним кодовым базам, многоходовые циклы агентов
* **Сильное следование инструкциям** — Gemma 4 явно настроена на использование инструментов, структурированный вывод и точное соблюдение ограничений
* **Многоязычность** — полная многоязычная поддержка из Gemma 3 сохранена, плюс расширенный набор бенчмарков для неанглийских языков
* **Открытые веса, условия Gemma** — бесплатно для большинства коммерческих применений; ознакомьтесь с [Политикой запрещённого использования Gemma](https://ai.google.dev/gemma/prohibited_use_policy) перед выпуском
* **Инструменты первого класса** — поддерживается из коробки в vLLM, SGLang, Ollama и Hugging Face Transformers

## Выберите свой вариант

| Вариант                                  | Всего параметров | Активный      | Контекст | Рекомендуемая квантизация | Рекомендуемый GPU на Clore                                                                                                  |
| ---------------------------------------- | ---------------- | ------------- | -------- | ------------------------- | --------------------------------------------------------------------------------------------------------------------------- |
| **Gemma 4 26B MoE** (`gemma-4-26b-it`)   | 26B              | \~4B на токен | 128K     | FP8 или 4-битный GPTQ     | 1× [RTX 4090](https://clore.ai/rent-4090.html?utm_source=docs\&utm_medium=guide\&utm_campaign=gemma4) (24 ГБ, квантизовано) |
| **Gemma 4 31B Dense** (`gemma-4-31b-it`) | 31B              | 31B (все)     | 128K     | FP8 или BF16              | 1× [H100](https://clore.ai/rent-h100.html?utm_source=docs\&utm_medium=guide\&utm_campaign=gemma4) (80 ГБ, BF16)             |

{% hint style="success" %}
**Практический выбор:** Для 90% развёртываний на одной GPU выбирайте **Gemma 4 26B MoE на FP8**. Вы получаете качество уровня Arena примерно за \~10–15 ток/с на 4090 и \~40+ ток/с на H100, без задержек, характерных для плотного 31B-инференса.
{% endhint %}

***

## Требования к серверу

| Компонент     | 26B MoE (4-бит, 4090)        | 26B MoE (FP8, H100)      | 31B Dense (BF16, H100)   |
| ------------- | ---------------------------- | ------------------------ | ------------------------ |
| VRAM GPU      | 24 ГБ                        | 80 ГБ                    | 80 ГБ                    |
| Системная RAM | 32GB                         | 64GB                     | 64GB                     |
| Диск          | 60GB NVMe                    | 80GB NVMe                | 90GB NVMe                |
| Сеть          | 100 Мбит/с для загрузки с HF | Предпочтительно 1 Гбит/с | Предпочтительно 1 Гбит/с |
| CUDA          | 12.8+                        | 12.8+                    | 12.8+                    |
| Драйвер       | 550+                         | 555+                     | 555+                     |

Закладывайте дополнительные \~20% запаса VRAM поверх статического объёма весов, чтобы покрыть KV-кэш на длинных контекстах. Параметр `--gpu-memory-utilization 0.90` в vLLM — хороший вариант по умолчанию.

***

## Быстрое развертывание на CLORE.AI

Самый быстрый путь: арендовать одну GPU, скачать стандартный `vllm/vllm-openai` образ и обслуживать модель через API, совместимый с OpenAI. Ниже приведена схема docker-compose, используемая в остальных руководствах — скорректируйте имя модели и размер tensor-parallel в зависимости от выбранного выше варианта.

### Вариант A — Gemma 4 26B MoE на одной GPU (vLLM, FP8)

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    environment:
      - HUGGING_FACE_HUB_TOKEN=${HF_TOKEN}
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model google/gemma-4-26b-it
      --quantization fp8
      --max-model-len 32768
      --gpu-memory-utilization 0.90
      --served-model-name gemma-4-26b
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
    shm_size: "8gb"

volumes:
  hf_cache:
```

```bash
# Запустите
HF_TOKEN=hf_xxx docker compose up -d

# Отслеживайте логи во время загрузки весов
docker compose logs -f vllm
```

{% hint style="info" %}
**Проверка лицензии:** Для моделей Gemma на Hugging Face нужно один раз на аккаунт принять условия Google. Откройте страницу модели в браузере, нажмите "Acknowledge license", затем экспортируйте `HF_TOKEN` чтобы контейнер мог скачать веса.
{% endhint %}

### Вариант B — Gemma 4 31B Dense на H100 (vLLM, BF16)

```bash
docker run --gpus all -p 8000:8000 \
  -e HUGGING_FACE_HUB_TOKEN=$HF_TOKEN \",
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  --ipc=host \\
  vllm/vllm-openai:latest \\
  --model google/gemma-4-31b-it \
  --dtype bfloat16 \\
  --max-model-len 32768 \
  --gpu-memory-utilization 0.90 \
  --served-model-name gemma-4-31b
```

### Вариант C — Gemma 4 31B Dense на 2× RTX 4090 (FP8, tensor-parallel)

```bash
docker run --gpus all -p 8000:8000 \
  -e HUGGING_FACE_HUB_TOKEN=$HF_TOKEN \",
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  --ipc=host \\
  vllm/vllm-openai:latest \\
  --model google/gemma-4-31b-it \
  --quantization fp8 \\
  --tensor-parallel-size 2 \
  --max-model-len 16384 \
  --gpu-memory-utilization 0.90 \
  --served-model-name gemma-4-31b
```

### Вариант D — Быстрое локальное тестирование с Ollama

Для экспериментов уровня ноутбука Ollama использует community-сборки GGUF. Ожидайте, что кванты появятся через несколько дней после официального релиза.

```bash
# Когда будет опубликована community-сборка GGUF
ollama pull gemma4:26b-moe-q4_k_m
ollama run gemma4:26b-moe-q4_k_m

# API, совместимый с OpenAI, на :11434
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \\
  -d '{
    "model": "gemma4:26b-moe-q4_k_m",
    "messages": [{"role":"user","content":"Суммируйте подход маршрутизации MoE в двух предложениях."}]
  }'
```

См. [руководство по Ollama](/guides/guides_v2-ru/yazykovye-modeli/ollama.md) для общих рекомендаций по настройке, управлению моделью и сохранению данных.

***

## Примеры использования

Контейнер vLLM предоставляет API, совместимый с OpenAI, на `:8000`. Всё, что поддерживает схему OpenAI chat-completions, работает напрямую.

### Завершение чата через curl

```bash
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "gemma-4-26b",
    "messages": [
      {"role": "system", "content": "Вы — внимательный технический писатель."},
      {"role": "user", "content": "Объясните маршрутизацию MoE в трёх предложениях без использования аналогий."}
    ],
    "max_tokens": 512,
    "temperature": 0.7
  }'
```

### Python (клиент OpenAI)

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

resp = client.chat.completions.create(
    model="gemma-4-26b",
    messages=[
        {"role": "system", "content": "Вы отвечаете обычным текстом, без markdown."},
        {"role": "user", "content": "Дайте мне контрольный список code review из 5 пунктов для Go HTTP handler."},
    ],
    temperature=0.7,
    max_tokens=1024,
)
print(resp.choices[0].message.content)
```

### Потоковые ответы

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

stream = client.chat.completions.create(
    model="gemma-4-26b",
    messages=[{"role": "user", "content": "Напишите хайку о распределённом инференсе."}],
    stream=True,
    max_tokens=128,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
print()
```

### Hugging Face Transformers (офлайн-использование)

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "google/gemma-4-26b-it"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    load_in_4bit=True,  # Помещает MoE на одну карту 24 ГБ
)

messages = [
    {"role": "user", "content": "Рефакторите эту функцию Python для читаемости:\n\ndef f(x): return [i for i in x if i%2==0 and i>10]"},
]
input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(input_ids, max_new_tokens=512, do_sample=True, temperature=0.7)
print(tokenizer.decode(output[0][input_ids.shape[-1]:], skip_special_tokens=True))
```

***

## Советы по производительности

* **Используйте FP8 на Hopper.** На H100 чекпойнт FP8 занимает примерно вдвое меньше памяти, чем BF16, без заметной потери качества в задачах следования инструкциям. Передайте `--quantization fp8` в vLLM.
* **Используйте 4-битный GPTQ на Ada (RTX 4090).** Для MoE-версии на одной 4090 практический оптимум — community-сборка GPTQ 4-bit; ожидайте \~10–15 ток/с. GGUF-сборки Q4\_K\_M от Ollama дают сопоставимое качество при более простой эксплуатации.
* **Tensor parallelism для 31B Dense.** На 2× RTX 4090 передайте `--tensor-parallel-size 2`. Зафиксируйте контекст на том, что вам действительно нужно (`--max-model-len 16384`) — каждое удвоение контекста примерно удваивает объём KV-кэша.
* **Экспертный параллелизм для MoE.** На многокарточных конфигурациях для 26B MoE, у vLLM `--enable-expert-parallel` это может дать заметный прирост пропускной способности при больших размерах batch. Для одной GPU это избыточно.
* **Chunked prefill для длинных контекстов.** Если выходите за 32K, добавьте `--enable-chunked-prefill` в vLLM. Это удерживает задержку prefill на приемлемом уровне и предотвращает задержки на пути декодирования.
* **Заранее скачайте веса.** Для временных аренд на Clore подключите постоянный том в `/root/.cache/huggingface` чтобы последующие запуски пропускали загрузку 50–60 ГБ.
* **Выберите подходящий backend для сервинга.** vLLM — надёжный выбор по умолчанию. SGLang часто выигрывает на Hopper в высококонкурентных нагрузках; см. [руководство по vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) для более широкого сравнения.

***

## Бенчмарки

{% hint style="warning" %}
**Числа, опубликованные производителем, — независимая проверка ещё не завершена.** Ниже приведённые цифры взяты из материалов запуска Google от 2 апреля 2026 года. Независимые воспроизведения на частных оценках всё ещё поступают. Рассматривайте рейтинг Arena и оценки фактичности как ориентировочные, а не абсолютные.
{% endhint %}

| Бенчмарк                             | Gemma 4 26B MoE                                                    | Gemma 4 31B Dense                                                 | Справка                 |
| ------------------------------------ | ------------------------------------------------------------------ | ----------------------------------------------------------------- | ----------------------- |
| LMSYS Arena (в целом)                | №3 на момент релиза                                                | примерно №5 на момент релиза                                      | по данным производителя |
| Следование инструкциям (IFEval)      | по данным производителя, значительный рост по сравнению с Gemma 3  | по данным производителя, значительный рост по сравнению с Gemma 3 | по данным производителя |
| Фактичность (SimpleQA / аналогичные) | по данным Google превосходит несколько закрытых моделей            | сопоставимо                                                       | по данным производителя |
| Многоязычность (Global-MMLU)         | по данным производителя, паритет с гораздо более крупными моделями | лучший результат Gemma на сегодняшний день                        | по данным производителя |

Позиционирование Gemma 4 — «больше пользы на активный параметр», а не «сырой король HumanEval». Если вам нужна чистая генерация кода, сравнивайте с [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) (передовое кодирование) или [Qwen3.5](/guides/guides_v2-ru/yazykovye-modeli/qwen35.md) (лучшей плотной моделью класса 35B). Если вам нужны длительные агентные циклы, GLM-5.1 всё ещё более точный инструмент.

***

## Устранение неполадок

| Проблема                                          | Решение                                                                                                                                                                                                                   |
| ------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` загрузка 26B MoE на 24 ГБ      | Переключитесь на FP8 (`--quantization fp8`) или 4-бит (`load_in_4bit=True` в Transformers). Уменьшите `--max-model-len` до 16384, чтобы уменьшить KV-кэш.                                                                 |
| `OutOfMemoryError` загрузка 31B Dense на H100     | BF16 при контексте 32K находится прямо на грани для 80 ГБ. Уменьшите `--max-model-len` до 16384 или перейдите на FP8.                                                                                                     |
| Скачивание с Hugging Face завершается ошибкой 403 | Вы не приняли лицензию Gemma на странице модели. Откройте URL в браузере, примите условия, затем повторно скачайте, используя токен с `правами чтения` доступа.                                                           |
| Очень медленный первый токен                      | Холодная загрузка весов (\~30–60 с на первом запросе) плюс prefill на длинных входах. Запустите тестовый прогревочный запрос после старта сервера. Добавьте `--enable-chunked-prefill` для нагрузок с длинным контекстом. |
| Искажённый вывод / циклы повторений               | Проверьте шаблон чата — `tokenizer.apply_chat_template` обязательно; не конкатенируйте `system`+`user` строки вручную. Установите `temperature=0.7` и `top_p=0.95` для общего использования.                              |
| Ненадёжный вывод инструментов / JSON              | Используйте `--guided-decoding-backend` или передайте JSON-схему через `response_format`. Модель хорошо следует ограничениям, но неструктурированные промпты всё равно будут уходить в сторону.                           |
| `неподдерживаемая квантизация` ошибка в vLLM      | Обновитесь до версии vLLM, выпущенной после апреля 2026 года (`pip install -U vllm --pre`). Архитектура Gemma 4 требует самых новых парсеров конфигурации.                                                                |

***

## FAQ

**Gemma 4 против Llama 4?** Разные формы для разных задач. [Llama 4 Scout](/guides/guides_v2-ru/yazykovye-modeli/llama4.md) имеет 109B/17B активных параметров и громкий контекст 10M — отлично, когда нужно скормить модели огромные входные данные. Gemma 4 26B MoE гораздо меньше по общему числу параметров (26B против 109B), активирует меньше параметров на токен (4B против 17B) и сильнее настроена на следование инструкциям и фактичность. При жёстком бюджете VRAM и важности качества на параметр Gemma 4 выигрывает. Если нужен абсурдно длинный контекст, выигрывает Llama 4 Scout.

**Сколько VRAM нужно для Gemma 4 26B MoE?**

* 4-битный GGUF / GPTQ: помещается в **24 ГБ** (одну RTX 4090), \~10–15 ток/с.
* FP8: комфортно на **40 ГБ**, быстро на **80 ГБ** (H100) при \~40+ ток/с.
* Полный BF16: \~55 ГБ весов плюс KV-кэш — планируйте **80 ГБ** карту.

**Можно ли использовать Gemma 4 коммерчески?** Да, в рамках стандартных условий использования Gemma. Ознакомьтесь с [Политикой запрещённого использования Gemma](https://ai.google.dev/gemma/prohibited_use_policy) перед развёртыванием — существуют ограничения на конкретные сценарии использования (обман, генерация CSAM, незаконная деятельность), и вы должны передавать уведомления о лицензии своим пользователям. Это не модель Apache 2.0 / MIT — это open-weight-модель, распространяемая по политике использования. Если вам нужна полностью неограниченная лицензия, [Qwen3.5](/guides/guides_v2-ru/yazykovye-modeli/qwen35.md) (Apache 2.0) или [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) (MIT) — альтернативы.

**Gemma 4 против DeepSeek-V4?** [DeepSeek-V4](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md) — это другой весовой класс: \~1T параметров, мультимодальность, контекст 1M. Используйте DeepSeek-V4, когда вам нужна сырая мощность и есть серьёзный GPU-стенд. Используйте Gemma 4 26B MoE, когда вам нужно сильное следование инструкциям на **одной GPU** и вам важны [голое железо](https://clore.ai/bare-metal) аренда на Clore. Gemma 4 — кандидат на звание «лучшая модель, помещающаяся на 4090»; DeepSeek-V4 — кандидат на звание «я заплачу за 8× H200».

**Поддерживает ли Gemma 4 vision / мультимодальные входы?** Главный релиз Gemma 4 — только текстовая модель, обученная на инструкциях (`*-it`). Google historically сопровождал текстовые релизы вариантами PaliGemma для vision — отслеживайте [huggingface.co/google](https://huggingface.co/google) для обновлений. Для открытой модели с поддержкой изображений сегодня посмотрите на [Kimi K2.5](/guides/guides_v2-ru/yazykovye-modeli/kimi-k2.md) или [Llama 4 Scout](/guides/guides_v2-ru/yazykovye-modeli/llama4.md).

***

## Связанные руководства

* [vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) — production-бэкенд для сервинга, используемый в этом руководстве
* [компонент](/guides/guides_v2-ru/yazykovye-modeli/ollama.md) — самый быстрый путь к локальному тестированию со сборками GGUF
* [Llama 4](/guides/guides_v2-ru/yazykovye-modeli/llama4.md) — MoE-альтернатива от Meta с контекстом 10M
* [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — MoE для кодирования передового уровня (744B/40B активных), когда размера Gemma недостаточно
* [Qwen3.5](/guides/guides_v2-ru/yazykovye-modeli/qwen35.md) — плотная 35B-модель с Apache 2.0, ещё один сильный вариант для одной GPU
* [Gemma 3](/guides/guides_v2-ru/yazykovye-modeli/gemma3.md) — предыдущее поколение, полезный ориентир для миграции

### Ссылки

* [Gemma 4 26B MoE на Hugging Face](https://huggingface.co/google/gemma-4-26b-it)
* [Gemma 4 31B Dense на Hugging Face](https://huggingface.co/google/gemma-4-31b-it)
* [условиями использования Gemma](https://ai.google.dev/gemma/terms)
* [Политикой запрещённого использования Gemma](https://ai.google.dev/gemma/prohibited_use_policy)
* [Документация vLLM](https://docs.vllm.ai)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/gemma4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
