> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/llama33.md).

# Llama 3.3 70B

{% hint style="info" %}
**Доступна более новая версия!** Выпущено Meta [**Llama 4**](/guides/guides_v2-ru/yazykovye-modeli/llama4.md) в апреле 2025 с архитектурой MoE — Scout (17B активных параметров, помещается на RTX 4090) обеспечивает сопоставимое качество при гораздо меньшем объёме VRAM. Рекомендуется обновиться.
{% endhint %}

Последняя и самая эффективная 70B-модель Meta на GPU CLORE.AI.

{% hint style="success" %}
Все примеры можно запускать на GPU-серверах, арендованных через [маркетплейс CLORE.AI](https://clore.ai/marketplace).
{% endhint %}

## Почему Llama 3.3?

* **Лучшая модель 70B** - Сопоставима по производительности с Llama 3.1 405B при значительно меньшей стоимости
* **Многоязычность** - Нативная поддержка 8 языков
* **Контекст 128K** - Обработка длинных документов
* **Открытые веса** - Бесплатно для коммерческого использования

## Обзор модели

| Характеристики  | Значение                       |
| --------------- | ------------------------------ |
| Параметры       | 70B                            |
| Длина контекста | 128K токенов                   |
| Данные обучения | 15T+ токенов                   |
| Языки           | EN, DE, FR, IT, PT, HI, ES, TH |
| Лицензия        | Лицензия сообщества Llama 3.3  |

### Производительность по сравнению с другими моделями

| Бенчмарк       | Llama 3.3 70B | Llama 3.1 405B | GPT-4o |
| -------------- | ------------- | -------------- | ------ |
| MMLU           | 86.0          | 87.3           | 88.7   |
| HumanEval      | 88.4          | 89.0           | 90.2   |
| MATH           | 77.0          | 73.8           | 76.6   |
| Многоязычность | 91.1          | 91.6           | -      |

## Требования к GPU

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

| Конфигурация  | VRAM  | Производительность | Стоимость                                                  |
| ------------- | ----- | ------------------ | ---------------------------------------------------------- |
| Квантовано Q4 | 40 ГБ | Хорошо             | A100 40GB ([голое железо](https://clore.ai/bare-metal))    |
| Квантовано Q8 | 70 ГБ | Лучше              | A100 80 ГБ ([голое железо](https://clore.ai/bare-metal))   |
| Полная FP16   | 140GB | Лучше всего        | 2x A100 80GB ([голое железо](https://clore.ai/bare-metal)) |

**Рекомендуется:** A100 40GB с квантованием Q4 для лучшего соотношения цены и производительности.

## Быстрое развертывание на CLORE.AI

### Использование Ollama (проще всего)

**Docker-образ:**

```
ollama/ollama
```

**Порты:**

```
22/tcp
11434/http
```

**После развёртывания:**

```bash
ollama pull llama3.3
ollama run llama3.3
```

### Использование vLLM (продакшн)

**Docker-образ:**

```
vllm/vllm-openai:latest
```

**Порты:**

```
22/tcp
8000/http
```

**Команда:**

```bash
python -m vllm.entrypoints.openai.api_server \\
    --model meta-llama/Llama-3.3-70B-Instruct \\
    --tensor-parallel-size 1 \\
    --max-model-len 32768 \
    --host 0.0.0.0
```

## Доступ к вашему сервису

После развертывания найдите свой `http_pub` URL в **Мои заказы**:

1. Перейдите на **Мои заказы** страницу
2. Нажмите на свой заказ
3. Найдите `http_pub` URL (например, `abc123.clorecloud.net`)

Используйте `https://YOUR_HTTP_PUB_URL` вместо `localhost` в примерах ниже.

## Методы установки

### Способ 1: Ollama (рекомендуется для тестирования)

```bash
# Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Скачайте Llama 3.3 (автоматически загрузится версия Q4)
ollama pull llama3.3

# Запустить интерактивно
ollama run llama3.3

# Или запустите API
ollama serve
```

**Использование API:**

```bash
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.3",
  "prompt": "Объясните квантовые вычисления простыми словами"
}'
```

### Способ 2: vLLM (продакшн)

```bash
pip install vllm

# Одна GPU (A100 40GB с квантованием AWQ)
python -m vllm.entrypoints.openai.api_server \\
    --model casperhansen/llama-3.3-70b-instruct-awq \\
    --quantization awq \\
    --max-model-len 16384 \
    --host 0.0.0.0

# Несколько GPU (2x A100 для полной точности)
python -m vllm.entrypoints.openai.api_server \\
    --model meta-llama/Llama-3.3-70B-Instruct \\
    --tensor-parallel-size 2 \
    --max-model-len 32768 \
    --host 0.0.0.0
```

**Использование API (совместимо с OpenAI):**

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")

response = client.chat.completions.create(
    model="meta-llama/Llama-3.3-70B-Instruct",
    messages=[
        {"role": "system", "content": "Вы — полезный помощник."},
        {"role": "user", "content": "Напишите функцию на Python для вычисления чисел Фибоначчи"}
    ],
    temperature=0.7,
    max_tokens=1024
)

print(response.choices[0].message.content)
```

### Способ 3: Transformers + bitsandbytes

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig

# Конфигурация 4-битного квантования
bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
    bnb_4bit_quant_type="nf4",
    bnb_4bit_compute_dtype=torch.bfloat16
)

model_id = "meta-llama/Llama-3.3-70B-Instruct"

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    quantization_config=bnb_config,
    device_map="auto"
)

# Генерировать
messages = [
    {"role": "system", "content": "Вы полезный помощник по программированию."},
    {"role": "user", "content": "Напишите Python-скрейпер веб-страниц с использованием BeautifulSoup"}
]

input_ids = tokenizer.apply_chat_template(
    messages,
    return_tensors="pt"
).to("cuda")

outputs = model.generate(
    input_ids,
    max_new_tokens=512,
    temperature=0.7,
    do_sample=True
)

print(tokenizer.decode(outputs[0], skip_special_tokens=True))
```

### Способ 4: llama.cpp (гибрид CPU+GPU)

```bash
# Клонируйте и соберите
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make LLAMA_CUDA=1

# Скачать модель GGUF
wget https://huggingface.co/bartowski/Llama-3.3-70B-Instruct-GGUF/resolve/main/Llama-3.3-70B-Instruct-Q4_K_M.gguf

# Запустить сервер
./llama-server \\
    -m Llama-3.3-70B-Instruct-Q4_K_M.gguf \\
    -c 8192 \\
    -ngl 80 \\
    --host 0.0.0.0 \
    --port 8080
```

## Бенчмарки

### Пропускная способность (токенов/секунду)

| GPU           | Q4    | Q8    | FP16  |
| ------------- | ----- | ----- | ----- |
| A100 40 ГБ    | 25-30 | -     | -     |
| A100 80 ГБ    | 35-40 | 25-30 | -     |
| 2x A100 80 ГБ | 50-60 | 40-45 | 30-35 |
| H100 80GB     | 60-70 | 45-50 | 35-40 |

### Время до первого токена (TTFT)

| GPU           | Q4       | FP16     |
| ------------- | -------- | -------- |
| A100 40 ГБ    | 0.8-1.2с | -        |
| A100 80 ГБ    | 0.6-0.9с | -        |
| 2x A100 80 ГБ | 0.4-0.6с | 0.8-1.0с |

### Длина контекста vs VRAM

| Контекст | Q4 VRAM | Q8 VRAM |
| -------- | ------- | ------- |
| 4K       | 38GB    | 72 ГБ   |
| 8K       | 40 ГБ   | 75GB    |
| 16K      | 44GB    | 80 ГБ   |
| 32K      | 52GB    | 90GB    |
| 64K      | 68GB    | 110GB   |
| 128K     | 100GB   | 150 ГБ  |

## Сценарии использования

### Генерация кода

```python
messages = [
    {"role": "system", "content": "Вы — эксперт-программист. Пишите чистый, эффективный, хорошо документированный код."},
    {"role": "user", "content": "Создайте REST API на FastAPI с аутентификацией пользователей с использованием JWT-токенов"}
]
```

### Анализ документов (длинный контекст)

```python
# Загрузите длинный документ
with open("large_document.txt") as f:
    document = f.read()

messages = [
    {"role": "system", "content": "Вы — аналитик документов. Предоставляйте подробный, точный анализ."},
    {"role": "user", "content": f"Проанализируйте этот документ и предоставьте краткое изложение с ключевыми моментами:\n\n{document}"}
]
```

### Многоязычные задачи

```python
messages = [
    {"role": "system", "content": "Вы — многоязычный помощник."},
    {"role": "user", "content": "Переведите это на немецкий, французский и испанский: 'The quick brown fox jumps over the lazy dog'"}
]
```

### Рассуждения и анализ

```python
messages = [
    {"role": "system", "content": "Думайте пошагово. Покажите ход рассуждений."},
    {"role": "user", "content": "Поезд отправляется со станции A в 9:00 утра со скоростью 60 миль/ч. Другой поезд отправляется со станции B (в 300 милях отсюда) в 10:00 утра, двигаясь в сторону станции A со скоростью 90 миль/ч. Когда и где они встретятся?"}
]
```

## Советы по оптимизации

### Оптимизация памяти

```python
# vLLM с оптимизацией памяти
python -m vllm.entrypoints.openai.api_server \\
    --model casperhansen/llama-3.3-70b-instruct-awq \\
    --quantization awq \\
    --gpu-memory-utilization 0.95 \\
    --max-model-len 8192
```

### Оптимизация скорости

```python
# Включите Flash Attention
python -m vllm.entrypoints.openai.api_server \\
    --model meta-llama/Llama-3.3-70B-Instruct \\
    --tensor-parallel-size 2 \
    --enable-prefix-caching
```

### Пакетная обработка

```python
# Эффективно обрабатывайте несколько запросов
responses = client.chat.completions.create(
    model="meta-llama/Llama-3.3-70B-Instruct",
    messages=messages,
    n=4,  # Сгенерировать 4 ответа
    temperature=0.8
)
```

## Сравнение с другими моделями

| Функция          | Llama 3.3 70B | Llama 3.1 70B | Qwen 2.5 72B | Mixtral 8x22B |
| ---------------- | ------------- | ------------- | ------------ | ------------- |
| MMLU             | 86.0          | 83.6          | 85.3         | 77.8          |
| Программирование | 88.4          | 80.5          | 85.4         | 75.5          |
| Математика       | 77.0          | 68.0          | 80.0         | 60.0          |
| Контекст         | 128K          | 128K          | 128K         | 64K           |
| Языки            | 8             | 8             | 29           | 8             |
| Лицензия         | Открыть       | Открыть       | Открыть      | Открыть       |

**Вердикт:** Llama 3.3 70B обеспечивает лучшую общую производительность в своём классе, особенно в задачах программирования и рассуждений.

## Устранение неполадок

### Недостаточно памяти

```bash
# Используйте квантование AWQ (наиболее экономично по памяти)
--model casperhansen/llama-3.3-70b-instruct-awq --quantization awq

# Уменьшите длину контекста
--max-model-len 8192

# Используйте тензорный параллелизм
--tensor-parallel-size 2
```

### Медленный первый ответ

* Первый запрос загружает модель на GPU — подождите 30–60 секунд
* Используйте `--enable-prefix-caching` для более быстрых последующих запросов
* Предварительно прогрейте фиктивным запросом

### Доступ к Hugging Face

```bash
# Войдите в HF (требуется для модели с ограниченным доступом)
huggingface-cli login

# Или задайте переменную окружения
export HUGGING_FACE_HUB_TOKEN=hf_xxxxx
```

## Оценка стоимости

| Конфигурация       | GPU             | $/час   | токенов/$ |
| ------------------ | --------------- | ------- | --------- |
| Бюджетная          | A100 40 ГБ (Q4) | \~$0.17 | \~530K    |
| Сбалансированная   | A100 80GB (Q4)  | \~$0.25 | \~500K    |
| Производительность | 2x A100 80 ГБ   | \~$0.50 | \~360K    |
| Максимум           | H100 80GB       | \~$0.50 | \~500K    |

## Дальнейшие шаги

* [Руководство по vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) - Развёртывание в production
* [Руководство по Ollama](/guides/guides_v2-ru/yazykovye-modeli/ollama.md) - Простая локальная настройка
* [Настройка нескольких GPU](/guides/guides_v2-ru/prodvinutyi/multi-gpu-setup.md) - Масштабируйтесь до более крупных моделей
* [Интеграция API](/guides/guides_v2-ru/prodvinutyi/api-integration.md) - Создавайте приложения


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/llama33.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
