> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/llama4.md).

# Llama 4 (Scout и Maverick)

Llama 4 от Meta, выпущенная в апреле 2025 года, знаменует собой фундаментальный переход к **Смесь экспертов (MoE)** архитектуре. Вместо активации всех параметров для каждого токена Llama 4 направляет каждый токен в специализированные подсети «экспертов», обеспечивая передовую производительность при доле вычислительных затрат. Доступны две модели с открытыми весами: **Scout** (идеально для одной GPU) и **Maverick** (мощная конфигурация для нескольких GPU).

## Ключевые особенности

* **Архитектура MoE**: Активно только 17B параметров на токен (из 109B/400B всего)
* **Огромные окна контекста**: Scout поддерживает 10M токенов, Maverick поддерживает 1M токенов
* **Нативно мультимодальная**: Понимает и текст, и изображения сразу из коробки
* **Две модели**: Scout (16 экспертов, удобен для одной GPU) и Maverick (128 экспертов, для нескольких GPU)
* **Конкурентоспособная производительность**: Scout сопоставим с Gemma 3 27B; Maverick конкурирует с моделями класса GPT-4o
* **Открытые веса**: Лицензия сообщества Llama (бесплатно для большинства коммерческих применений)

## Варианты модели

| Модель       | Всего параметров | Активные параметры | Эксперты | Контекст | Мин. VRAM (Q4)    | Мин. VRAM (FP16)   |
| ------------ | ---------------- | ------------------ | -------- | -------- | ----------------- | ------------------ |
| **Scout**    | 109B             | 17B                | 16       | 10M      | 12GB              | 80 ГБ              |
| **Maverick** | 400B             | 17B                | 128      | 1M       | 48 ГБ (несколько) | 320 ГБ (несколько) |

## Требования

| Компонент | Scout (Q4)  | Scout (FP16) | Maverick (Q4) |
| --------- | ----------- | ------------ | ------------- |
| GPU       | 1× RTX 4090 | 1× H100      | 4× RTX 4090   |
| VRAM      | 24 ГБ       | 80 ГБ        | 4×24GB        |
| ОЗУ       | 32GB        | 64GB         | 128 ГБ        |
| Диск      | 50 ГБ       | 120 ГБ       | 250 ГБ        |
| CUDA      | 12.8+       | 12.8+        | 12.8+         |

**Рекомендуемая GPU от Clore.ai**: RTX 4090 24 ГБ ($0.14–0.42/ч) для Scout — лучшее соотношение цены и качества

## Быстрый старт с Ollama

Самый быстрый способ запустить Llama 4:

```bash
# Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Запуск Scout (квантованная, ~12 ГБ VRAM)
ollama run llama4-scout

# Для более длинного контекста (использует больше VRAM)
ollama run llama4-scout --ctx-size 32768
```

### Ollama как API-сервер

```bash
# Запустить сервер в фоновом режиме
ollama serve &

# Скачать модель
ollama pull llama4-scout

# Запрос через API, совместимый с OpenAI
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \\
  -d '{
    "model": "llama4-scout",
    "messages": [{"role": "user", "content": "Объясните архитектуру MoE в 3 предложениях"}]
  }'
```

## Настройка vLLM (production)

Для production-нагрузок с более высокой пропускной способностью:

```bash
# Установить vLLM
pip install vllm

# Развернуть Scout на одной GPU (квантованная версия)
vllm serve meta-llama/Llama-4-Scout-17B-16E-Instruct \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.90

# Развернуть Scout на 2 GPU (более длинный контекст)
vllm serve meta-llama/Llama-4-Scout-17B-16E-Instruct \
  --tensor-parallel-size 2 \
  --max-model-len 128000 \
  --gpu-memory-utilization 0.90

# Развернуть Maverick на 4 GPU
vllm serve meta-llama/Llama-4-Maverick-17B-128E-Instruct \
  --tensor-parallel-size 4 \
  --max-model-len 65536
```

### Запрос к серверу vLLM

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")

response = client.chat.completions.create(
    model="meta-llama/Llama-4-Scout-17B-16E-Instruct",
    messages=[
        {"role": "system", "content": "Вы — полезный помощник."},
        {"role": "user", "content": "Напишите функцию на Python для вычисления чисел Фибоначчи"}
    ],
    temperature=0.7,
    max_tokens=1024
)
print(response.choices[0].message.content)
```

## HuggingFace Transformers

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "meta-llama/Llama-4-Scout-17B-16E-Instruct"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    load_in_4bit=True  # 4-битная квантовка для GPU с 24 ГБ
)

messages = [
    {"role": "system", "content": "Вы — полезный ассистент по программированию."},
    {"role": "user", "content": "Напишите REST API на FastAPI, который управляет списком задач"}
]

input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(input_ids, max_new_tokens=2048, temperature=0.7, do_sample=True)
print(tokenizer.decode(output[0][input_ids.shape[-1]:], skip_special_tokens=True))
```

## Быстрый старт с Docker

```bash
# Использование Docker-образа vLLM
docker run --gpus all -p 8000:8000 \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:latest \\
  --model meta-llama/Llama-4-Scout-17B-16E-Instruct \
  --max-model-len 32768
```

## Почему MoE важна на Clore.ai

Традиционные плотные модели (например, Llama 3.3 70B) требуют огромного объёма VRAM, потому что активны все 70B параметров. У Llama 4 Scout всего 109B параметров, но на токен активируется только 17B — это означает:

* **То же качество, что у плотных моделей 70B+** при доле затрат на VRAM
* **Помещается на одной RTX 4090** в квантованном режиме
* **Контекст на 10M токенов** — обрабатывать целые кодовые базы, длинные документы, книги
* **Дешевле арендовать** — одна RTX 4090 за $0.14–0.42/ч вместо многопроцессорной установки для моделей 70B

## Советы для пользователей Clore.ai

* **Начните с Scout Q4**: Лучшее соотношение цены и качества на RTX 4090 — $0.14–0.42/ч, покрывает 95% случаев использования
* **Используйте `--max-model-len` с умом**: Не задавайте контекст выше необходимого — это резервирует VRAM. Начните с 8192 и увеличивайте по мере необходимости
* **Тензорный параллелизм для Maverick**: Арендуйте машины с 4× RTX 4090 для Maverick; используйте `--tensor-parallel-size 4`
* **Требуется вход в HuggingFace**: `huggingface-cli login` — сначала нужно принять лицензию Llama на HF
* **Ollama для быстрых тестов, vLLM для production**: Ollama быстрее настраивается; vLLM обеспечивает более высокую пропускную способность для обслуживания API
* **Следите за памятью GPU**: `watch nvidia-smi` — модели MoE могут резко увеличивать потребление VRAM на длинных последовательностях

## Устранение неполадок

| Проблема                                   | Решение                                                                                 |
| ------------------------------------------ | --------------------------------------------------------------------------------------- |
| `OutOfMemoryError`                         | Уменьшите `--max-model-len`, используйте Q4-квантование или обновите GPU                |
| Сбой загрузки модели                       | Запускайте `huggingface-cli login` и примите лицензию Llama 4 на hf.co                  |
| Медленная генерация                        | Убедитесь, что используется GPU (`nvidia-smi`); проверьте `--gpu-memory-utilization`    |
| vLLM аварийно завершает работу при запуске | Уменьшите длину контекста; убедитесь, что установлен CUDA 11.8+                         |
| Ollama показывает неверную модель          | Запускайте `ollama list` для проверки; `ollama rm` + `ollama pull` чтобы скачать заново |

## Дополнительное чтение

* [Пост в блоге Meta Llama 4](https://llama.meta.com/)
* [Карточка модели HuggingFace](https://huggingface.co/meta-llama/Llama-4-Scout-17B-16E-Instruct)
* [Документация vLLM](https://docs.vllm.ai/)
* [Библиотека моделей Ollama](https://ollama.com/library/llama4-scout)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/llama4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
