> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/gemma3.md).

# Gemma 3

Запустите мультимодальные модели Google Gemma 3 на Clore.ai — превосходит Llama-405B, будучи в 15 раз меньше

Gemma 3, выпущенная Google DeepMind в марте 2025 года, построена на той же технологии, что и Gemini 2.0. Её главное достижение: **модель 27B превосходит Llama 3.1 405B** в бенчмарках LMArena — модель, в 15 раз превосходящая его по размеру. Она изначально мультимодальна (текст + изображения + видео), поддерживает контекст 128K и работает на одной RTX 4090 с квантизацией.

## Ключевые особенности

* **Бьёт намного выше своего веса**: 27B превосходит модели класса 405B в основных бенчмарках
* **Изначально мультимодальная**: Встроенное понимание текста, изображений и видео
* **Контекстное окно 128K**: Обработка длинных документов, кодовых баз, разговоров
* **Четыре размера**: 1B, 4B, 12B, 27B — что-то для любого бюджета GPU
* **Версии QAT**: Варианты обучения с учётом квантизации позволяют 27B работать на потребительских GPU
* **Широкая поддержка фреймворков**: Ollama, vLLM, Transformers, Keras, JAX, PyTorch

## Варианты модели

| Модель          | Параметры | Видеопамять (Q4) | VRAM (FP16) | Лучше всего для                               |
| --------------- | --------- | ---------------- | ----------- | --------------------------------------------- |
| Gemma 3 1B      | 1B        | 1,5 ГБ           | 3GB         | Периферия, мобильные устройства, тестирование |
| Gemma 3 4B      | 4B        | 4 ГБ             | 9 ГБ        | Бюджетные GPU, быстрые задачи                 |
| Gemma 3 12B     | 12B       | 10 ГБ            | 25 ГБ       | Сбалансированное качество/скорость            |
| Gemma 3 27B     | 27B       | 18 ГБ            | 54 ГБ       | Лучшее качество, продакшн                     |
| Gemma 3 27B QAT | 27B       | 14 ГБ            | —           | Оптимизировано для потребительских GPU        |

## Требования

| Компонент | Gemma 3 4B | Gemma 3 27B (Q4) | Gemma 3 27B (FP16) |
| --------- | ---------- | ---------------- | ------------------ |
| GPU       | RTX 3060   | RTX 4090         | 2× RTX 4090 / A100 |
| VRAM      | 6 ГБ       | 24 ГБ            | 48 ГБ+             |
| ОЗУ       | 16GB       | 32GB             | 64GB               |
| Диск      | 10 ГБ      | 25 ГБ            | 55 ГБ              |
| CUDA      | 12.8+      | 12.8+            | 12.8+              |

**Рекомендуемая GPU от Clore.ai**: RTX 4090 24GB ($0.14–0.42/час) для квантизированного 27B — золотая середина

## Быстрый старт с Ollama

```bash
# Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Запуск разных размеров
ollama run gemma3:1b     # Миниатюрная — 1,5 ГБ видеопамяти
ollama run gemma3:4b     # Малая — 4 ГБ видеопамяти
ollama run gemma3:12b    # Средняя — 10 ГБ видеопамяти
ollama run gemma3:27b    # Большая — 18–20 ГБ видеопамяти (квантизированная)

# Версия QAT (оптимизированная квантизация)
ollama run gemma3:27b-qat
```

### Сервер API Ollama

```bash
ollama serve &

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \\
  -d '{
    "model": "gemma3:27b",
    "messages": [{"role": "user", "content": "Compare REST vs GraphQL for a new API"}]
  }'
```

### Работа с изображениями в Ollama

```bash
# Анализ изображения
ollama run gemma3:27b "Опишите это изображение подробно" --images ./photo.jpg
```

## Настройка vLLM (продакшн)

```bash
pip install vllm

# Развернуть модель 27B
vllm serve google/gemma-3-27b-it \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.90

# Развернуть с более длинным контекстом на 2 GPU
vllm serve google/gemma-3-27b-it \
  --tensor-parallel-size 2 \
  --max-model-len 65536

# Развернуть 4B для бюджетных конфигураций
vllm serve google/gemma-3-4b-it \
  --max-model-len 32768
```

## HuggingFace Transformers

### Генерация текста

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "google/gemma-3-27b-it"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    load_in_4bit=True  # Помещается на GPU с 24 ГБ
)

messages = [
    {"role": "user", "content": "Напишите класс на Python для бинарного дерева поиска с методами insert, search и delete"}
]

input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(input_ids, max_new_tokens=2048, temperature=0.7, do_sample=True)
print(tokenizer.decode(output[0][input_ids.shape[-1]:], skip_special_tokens=True))
```

### Зрение (понимание изображений)

```python
import torch
from transformers import AutoProcessor, Gemma3ForConditionalGeneration
from PIL import Image

model_name = "google/gemma-3-27b-it"
processor = AutoProcessor.from_pretrained(model_name)
model = Gemma3ForConditionalGeneration.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

# Загрузить изображение
image = Image.open("screenshot.png")

messages = [
    {"role": "user", "content": [
        {"type": "image", "image": image},
        {"type": "text", "text": "Что показывает этот скриншот? Перечислите все элементы интерфейса."}
    ]}
]

inputs = processor.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=1024)
print(processor.decode(output[0], skip_special_tokens=True))
```

## Быстрый старт с Docker

```bash
docker run --gpus all -p 8000:8000 \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:latest \\
  --model google/gemma-3-27b-it \
  --max-model-len 8192
```

## Основные результаты бенчмарков

| Бенчмарк               | Gemma 3 27B                | Llama 3.1 70B              | Llama 3.1 405B          |
| ---------------------- | -------------------------- | -------------------------- | ----------------------- |
| Рейтинг ELO LMArena    | 1354                       | 1298                       | 1337                    |
| MMLU                   | 75.6                       | 79.3                       | 85.2                    |
| HumanEval              | 72.0                       | 72.6                       | 80.5                    |
| Видеопамять (Q4)       | 18 ГБ                      | 40 ГБ                      | 200 ГБ+                 |
| **Стоимость на Clore** | **$0.14–0.42/ч** (1× 4090) | **$0.28–0.84/ч** (2× 4090) | **нет на маркетплейсе** |

27B обеспечивает качество общения уровня 405B при расходе видеопамяти в 10 раз меньше.

## Советы для пользователей Clore.ai

* **27B QAT — золотая середина**: Обучение с учётом квантизации означает меньшую потерю качества, чем послетренировочная квантизация — запускайте на одной RTX 4090
* **Зрение бесплатно**: Дополнительная настройка не нужна — Gemma 3 изначально понимает изображения. Отлично подходит для разбора документов, анализа скриншотов, чтения графиков
* **Начинайте с короткого контекста**: Используйте `--max-model-len 8192` сначала; увеличивайте только при необходимости, чтобы экономить видеопамять
* **4B для бюджетных запусков**: Если у вас RTX 3060/3070 ($0.03–0.07/час), модель 4B всё равно превосходит модели 27B прошлого поколения
* **Авторизация Google не требуется**: В отличие от некоторых моделей, Gemma 3 скачивается без ограничений (просто примите лицензию на HuggingFace)

## Устранение неполадок

| Проблема                                    | Решение                                                                                       |
| ------------------------------------------- | --------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` на 27B                   | Используйте версию QAT или уменьшите `--max-model-len` до 4096                                |
| Работа с изображениями не работает в Ollama | Обновите Ollama до последней версии: `curl -fsSL https://ollama.com/install.sh \| sh`         |
| Низкая скорость генерации                   | Проверьте, что вы используете bfloat16, а не float32. Используйте `--dtype bfloat16`          |
| Модель выдаёт мусор                         | Убедитесь, что вы используете `-it` вариант (дообученный для инструкций), а не базовую модель |
| Ошибка 403 при загрузке                     | Примите лицензию Gemma на <https://huggingface.co/google/gemma-3-27b-it>                      |

## Дополнительное чтение

* [Технический отчёт Gemma 3](https://ai.google.dev/gemma)
* [Карточка модели HuggingFace](https://huggingface.co/google/gemma-3-27b-it)
* [Библиотека Ollama](https://ollama.com/library/gemma3)
* [Google AI Studio](https://aistudio.google.com/) — попробуйте Gemma 3 онлайн, прежде чем арендовать GPU


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/gemma3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
