> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/deepseek-v3.md).

# DeepSeek-V3

Запускайте DeepSeek-V3 — передовую open-source LLM с исключительными возможностями рассуждения на GPU CLORE.AI.

{% hint style="success" %}
Все примеры можно запускать на GPU-серверах, арендованных через [маркетплейс CLORE.AI](https://clore.ai/marketplace).
{% endhint %}

{% hint style="info" %}
**Обновлено: DeepSeek-V3-0324 (март 2024)** — В последней ревизии DeepSeek-V3 появились значительные улучшения в генерации кода, математическом рассуждении и общем решении задач. Подробности см. в [журнале изменений](#whats-new-in-deepseek-v3-0324) .
{% endhint %}

## Почему DeepSeek-V3?

* **Передовой** - Соперничает с GPT-4o и Claude 3.5 Sonnet
* **671 млрд MoE** - Всего 671 млрд параметров, 37 млрд активных на токен (эффективный вывод)
* **Улучшенное рассуждение** - DeepSeek-V3-0324 значительно лучше справляется с математикой и кодом
* **Эффективный** - Архитектура MoE снижает вычислительные затраты по сравнению с плотными моделями
* **Открытый исходный код** - Полностью открытые веса под лицензией MIT
* **Длинный контекст** - Контекстное окно на 128K токенов

## Что нового в DeepSeek-V3-0324

DeepSeek-V3-0324 (ревизия марта 2024) вносит значимые улучшения в ключевых областях:

### Генерация кода

* **+8–12% на HumanEval** по сравнению с исходным V3
* Лучше работает с многомодульными кодовыми базами и сложными задачами рефакторинга
* Улучшенное понимание современных фреймворков (FastAPI, Pydantic v2, LangChain v0.3)
* Более надежно генерирует полный, рабочий код без пропусков

### Математическое рассуждение

* **+5% на MATH-500** бенчмарке
* Лучшее пошаговое построение доказательств
* Улучшенная числовая точность для многошаговых задач
* Расширенная способность находить и исправлять ошибки по ходу решения

### Общее рассуждение

* Более сильная логическая дедукция и причинно-следственный вывод
* Лучше справляется с многошаговым планированием
* Более стабильная производительность на краевых случаях и неоднозначных запросах
* Улучшенное следование инструкциям в сложных запросах с множеством ограничений

## Быстрое развертывание на CLORE.AI

**Docker-образ:**

```
vllm/vllm-openai:latest
```

**Порты:**

```
22/tcp
8000/http
```

**Команда (требуется несколько GPU):**

```bash
python -m vllm.entrypoints.openai.api_server \\
    --model deepseek-ai/DeepSeek-V3-0324 \\
    --host 0.0.0.0 \
    --port 8000 \\
    --tensor-parallel-size 8 \
    --trust-remote-code
```

## Доступ к вашему сервису

После развертывания найдите свой `http_pub` URL в **Мои заказы**:

1. Перейдите на **Мои заказы** страницу
2. Нажмите на свой заказ
3. Найдите `http_pub` URL (например, `abc123.clorecloud.net`)

Используйте `https://YOUR_HTTP_PUB_URL` вместо `localhost` в примерах ниже.

### Проверьте, что он работает

```bash
# Проверьте, готов ли сервис
curl https://your-http-pub.clorecloud.net/health

# Список доступных моделей
curl https://your-http-pub.clorecloud.net/v1/models

# Получить версию
curl https://your-http-pub.clorecloud.net/version
```

{% hint style="warning" %}
**Важно:** Для DeepSeek-V3 требуются **8x A100 80 ГБ** GPU и значительное время на загрузку. Ошибка HTTP 502 может сохраняться 15–30 минут, пока модель загружается.
{% endhint %}

## Варианты модели

| Модель            | Параметры | Активный | Требуемая VRAM | HuggingFace                                                                                             |
| ----------------- | --------- | -------- | -------------- | ------------------------------------------------------------------------------------------------------- |
| DeepSeek-V3-0324  | 671 млрд  | 37 млрд  | 8x80GB         | [deepseek-ai/DeepSeek-V3-0324](https://huggingface.co/deepseek-ai/DeepSeek-V3-0324)                     |
| DeepSeek-V3       | 671 млрд  | 37 млрд  | 8x80GB         | [deepseek-ai/DeepSeek-V3](https://huggingface.co/deepseek-ai/DeepSeek-V3)                               |
| DeepSeek-V3-Base  | 671 млрд  | 37 млрд  | 8x80GB         | [deepseek-ai/DeepSeek-V3-Base](https://huggingface.co/deepseek-ai/DeepSeek-V3-Base)                     |
| DeepSeek-V2.5     | 236 млрд  | 21 млрд  | 4x80GB         | [deepseek-ai/DeepSeek-V2.5](https://huggingface.co/deepseek-ai/DeepSeek-V2.5)                           |
| DeepSeek-V2-Lite  | 16B       | 2,4 млрд | 16GB           | [deepseek-ai/DeepSeek-V2-Lite](https://huggingface.co/deepseek-ai/DeepSeek-V2-Lite)                     |
| DeepSeek-Coder-V2 | 236 млрд  | 21 млрд  | 4x80GB         | [deepseek-ai/DeepSeek-Coder-V2-Instruct](https://huggingface.co/deepseek-ai/DeepSeek-Coder-V2-Instruct) |

## Требования к оборудованию

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

### Полная точность

| Модель           | Минимум       | Рекомендуется |
| ---------------- | ------------- | ------------- |
| DeepSeek-V3-0324 | 8x A100 80 ГБ | 8x H100 80GB  |
| DeepSeek-V2.5    | 4x A100 80GB  | 4x H100 80GB  |
| DeepSeek-V2-Lite | RTX 4090 24GB | A100 40 ГБ    |

### Квантованная (AWQ/GPTQ)

| Модель           | Квантование | VRAM   |
| ---------------- | ----------- | ------ |
| DeepSeek-V3-0324 | INT4        | 4x80GB |
| DeepSeek-V2.5    | INT4        | 2x80GB |
| DeepSeek-V2-Lite | INT4        | 8 ГБ   |

## Установка

### Использование vLLM (рекомендуется)

```bash
pip install vllm==0.7.3

# DeepSeek-V3-0324 (последняя версия, 8 GPU)
python -m vllm.entrypoints.openai.api_server \\
    --model deepseek-ai/DeepSeek-V3-0324 \\
    --tensor-parallel-size 8 \
    --trust-remote-code \\
    --host 0.0.0.0 \
    --port 8000

# Исходный V3 (всё ещё доступен)
python -m vllm.entrypoints.openai.api_server \\
    --model deepseek-ai/DeepSeek-V3 \\
    --tensor-parallel-size 8 \
    --trust-remote-code \\
    --host 0.0.0.0 \
    --port 8000
```

### Использование Transformers

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "deepseek-ai/DeepSeek-V3-0324"

tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    trust_remote_code=True
)

messages = [{"role": "user", "content": "Объясни квантовые вычисления простыми словами."}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)

outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
```

### Использование Ollama

```bash
# Скачать DeepSeek-V3 (требует значительных ресурсов)
ollama pull deepseek-v3

# Или более легкий вариант
ollama pull deepseek-coder-v2:16b

# Запуск
ollama run deepseek-v3
```

## Использование API

### Совместимый с OpenAI API (vLLM)

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

response = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[
        {"role": "system", "content": "Вы — полезный AI-ассистент."},
        {"role": "user", "content": "Напиши функцию на Python для поиска простых чисел."}
    ],
    temperature=0.7,
    max_tokens=1000
)

print(response.choices[0].message.content)
```

### Потоковая передача

```python
stream = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[{"role": "user", "content": "Объясни машинное обучение"}],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
```

### cURL

```bash
curl http://localhost:8000/v1/chat/completions \\
    -H "Content-Type: application/json" \\
    -d '{
        "model": "deepseek-ai/DeepSeek-V3-0324",
        "messages": [
            {"role": "user", "content": "Какова столица Франции?"}
        ],
        "temperature": 0.7
    }'
```

## DeepSeek-V2-Lite (одна GPU)

Для пользователей с ограниченным оборудованием:

```bash
# Использование vLLM
python -m vllm.entrypoints.openai.api_server \\
    --model deepseek-ai/DeepSeek-V2-Lite \\
    --trust-remote-code \\
    --host 0.0.0.0

# Использование Ollama
ollama run deepseek-coder-v2:16b
```

```python
# Использование Transformers на одной GPU
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model = AutoModelForCausalLM.from_pretrained(
    "deepseek-ai/DeepSeek-V2-Lite",
    torch_dtype=torch.float16,
    device_map="cuda",
    trust_remote_code=True
)
tokenizer = AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V2-Lite", trust_remote_code=True)
```

## Генерация кода

DeepSeek-V3-0324 — лучший в своем классе для кода:

```python
prompt = """Напишите класс на Python для двоичного дерева поиска с:
- вставкой
- поиском
- удалением
- обходом in-order
Добавьте аннотации типов и строки документации."""

response = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[{"role": "user", "content": prompt}],
    temperature=0.2  # Ниже для кода
)

print(response.choices[0].message.content)
```

Продвинутые задачи по коду, в которых V3-0324 особенно хорош:

```python
# Рефакторинг нескольких файлов
prompt = """У меня есть Flask-приложение, весь код находится в app.py (500 строк).
Рефакторизуйте его, чтобы использовать паттерн application factory с blueprint'ами для:
- auth (вход, регистрация, выход)
- api (REST-эндпоинты)
- admin (панель управления)
Покажите полную структуру файлов и все файлы."""

response = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[{"role": "user", "content": prompt}],
    temperature=0.1,
    max_tokens=4000
)
```

## Математика и рассуждение

```python
# Сложная математическая задача
prompt = """Докажите, что для любого целого n >= 1 сумма 1^2 + 2^2 + ... + n^2 = n(n+1)(2n+1)/6.
Используйте математическую индукцию и покажите все шаги ясно."""

response = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3-0324",
    messages=[{"role": "user", "content": prompt}],
    temperature=0.1  # Очень низкая для математики
)

print(response.choices[0].message.content)
```

## Конфигурация нескольких GPU

### 8 GPU (полная модель — V3-0324)

```bash
python -m vllm.entrypoints.openai.api_server \\
    --model deepseek-ai/DeepSeek-V3-0324 \\
    --tensor-parallel-size 8 \
    --max-model-len 32768 \
    --gpu-memory-utilization 0.9 \\
    --trust-remote-code
```

### 4 GPU (V2.5)

```bash
python -m vllm.entrypoints.openai.api_server \\
    --model deepseek-ai/DeepSeek-V2.5 \\
    --tensor-parallel-size 4 \
    --max-model-len 16384 \
    --trust-remote-code
```

## Производительность

### Пропускная способность (токенов/с)

| Модель                | GPU           | Контекст | Токенов/сек |
| --------------------- | ------------- | -------- | ----------- |
| DeepSeek-V3-0324      | 8x H100       | 32K      | \~85        |
| DeepSeek-V3-0324      | 8x A100 80 ГБ | 32K      | \~52        |
| DeepSeek-V3-0324 INT4 | 4x A100 80GB  | 16K      | \~38        |
| DeepSeek-V2.5         | 4x A100 80GB  | 16K      | \~70        |
| DeepSeek-V2.5         | 2x A100 80 ГБ | 8K       | \~45        |
| DeepSeek-V2-Lite      | RTX 4090      | 8K       | \~40        |
| DeepSeek-V2-Lite      | RTX 3090      | 4K       | \~25        |

### Время до первого токена (TTFT)

| Модель           | Конфигурация | TTFT      |
| ---------------- | ------------ | --------- |
| DeepSeek-V3-0324 | 8x H100      | \~750 мс  |
| DeepSeek-V3-0324 | 8× A100      | \~1100 мс |
| DeepSeek-V2.5    | 4× A100      | \~500 мс  |
| DeepSeek-V2-Lite | RTX 4090     | \~150 мс  |

### Использование памяти

| Модель           | Точность | Требуемая VRAM |
| ---------------- | -------- | -------------- |
| DeepSeek-V3-0324 | FP16     | 8x 80GB        |
| DeepSeek-V3-0324 | INT4     | 4x 80GB        |
| DeepSeek-V2.5    | FP16     | 4x 80GB        |
| DeepSeek-V2.5    | INT4     | 2x 80GB        |
| DeepSeek-V2-Lite | FP16     | 20 ГБ          |
| DeepSeek-V2-Lite | INT4     | 10 ГБ          |

## Бенчмарки

### DeepSeek-V3-0324 против конкурентов

| Бенчмарк           | V3-0324 | V3 (исходный) | GPT-4o | Claude 3.5 Sonnet |
| ------------------ | ------- | ------------- | ------ | ----------------- |
| MMLU               | 88.5%   | 87.1%         | 88.7%  | 88.3%             |
| HumanEval          | 90.2%   | 82.6%         | 90.2%  | 92.0%             |
| MATH-500           | 67.1%   | 61.6%         | 76.6%  | 71.1%             |
| GSM8K              | 92.1%   | 89.3%         | 95.8%  | 96.4%             |
| LiveCodeBench      | 72.4%   | 65.9%         | 71.3%  | 73.8%             |
| Рейтинг Codeforces | 1850    | 1720          | 1780   | 1790              |

*Примечание: улучшение MATH-500 от V3 → V3-0324 составляет +5,5 процентных пункта.*

## Docker Compose

```yaml
version: '3.8'

services:
  deepseek:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - ~/.cache/huggingface:/root/.cache/huggingface
    environment:
      - HUGGING_FACE_HUB_TOKEN=${HF_TOKEN}
    command: >
      --model deepseek-ai/DeepSeek-V2-Lite
      --host 0.0.0.0
      --port 8000
      --trust-remote-code
      --gpu-memory-utilization 0.9
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
```

## Сводка требований к GPU

| Сценарий использования  | Рекомендуемая конфигурация | Стоимость/час |
| ----------------------- | -------------------------- | ------------- |
| Полный DeepSeek-V3-0324 | 8x A100 80 ГБ              | \~$2.00       |
| DeepSeek-V2.5           | 4x A100 80GB               | \~$1.00       |
| Разработка/тестирование | RTX 4090 (V2-Lite)         | \~$0.10       |
| Production API          | 8x H100 80GB               | \~$3.00       |

## Оценка стоимости

Типичные расценки маркетплейса CLORE.AI:

| Конфигурация GPU | Почасовая ставка | Дневная ставка |
| ---------------- | ---------------- | -------------- |
| RTX 4090 24GB    | \~$0.10          | \~$2.30        |
| A100 40 ГБ       | \~$0.17          | \~$4.00        |
| A100 80 ГБ       | \~$0.25          | \~$6.00        |
| 4x A100 80GB     | \~$1.00          | \~$24.00       |
| 8x A100 80 ГБ    | \~$2.00          | \~$48.00       |

*Цены зависят от провайдера. Проверьте* [*маркетплейс CLORE.AI*](https://clore.ai/marketplace) *актуальные тарифы.*

**Сэкономьте деньги:**

* Используйте **Spot** Рынок спотовых серверов для разработки — примерно у трети цена spot ниже on-demand (медиана \~13% ниже), у остальных она совпадает
* Платите **CLORE** токенами
* Используйте DeepSeek-V2-Lite для тестирования перед масштабированием

## Устранение неполадок

### Недостаточно памяти

```bash
# Уменьшите длину контекста
--max-model-len 8192

# Или используйте квантизацию
--quantization awq

# Для V2-Lite на GPU 12 ГБ
--gpu-memory-utilization 0.85
--max-model-len 4096
```

### Медленная загрузка модели

```bash
# Предзагрузка
huggingface-cli download deepseek-ai/DeepSeek-V3-0324

# Или используйте зеркало
export HF_ENDPOINT=https://hf-mirror.com
```

### Ошибка trust\_remote\_code

```bash
# Всегда включайте этот флаг для моделей DeepSeek
--trust-remote-code
```

### Несколько GPU не работают

```bash
# Проверьте NCCL
nvidia-smi topo -m

# Установите переменные NCCL
export NCCL_DEBUG=INFO
export NCCL_P2P_DISABLE=0
```

## DeepSeek против других

| Функция    | DeepSeek-V3-0324            | Llama 3.1 405B | Mixtral 8x22B               |
| ---------- | --------------------------- | -------------- | --------------------------- |
| Параметры  | 671 млрд (37 млрд активных) | 405B           | 176 млрд (44 млрд активных) |
| Контекст   | 128K                        | 128K           | 64K                         |
| Код        | **Отлично**                 | Отлично        | Хорошо                      |
| Математика | **Отлично**                 | Хорошо         | Хорошо                      |
| Мин. VRAM  | 8x80GB                      | 8x80GB         | 2x80GB                      |
| Лицензия   | MIT                         | Llama 3.1      | Apache 2.0                  |

**Используйте DeepSeek-V3, когда:**

* Нужна наилучшая производительность рассуждения
* Генерация кода — основная задача
* Важны задачи по математике/логике
* Доступна конфигурация с несколькими GPU
* Нужны полностью open-source веса (лицензия MIT)

## Дальнейшие шаги

* [vLLM](/guides/guides_v2-ru/yazykovye-modeli/vllm.md) - Сервер для развертывания
* [DeepSeek-R1](/guides/guides_v2-ru/yazykovye-modeli/deepseek-r1.md) - Вариант, специализированный на рассуждении
* [DeepSeek Coder](/guides/guides_v2-ru/yazykovye-modeli/deepseek-coder.md) - Специализированный вариант для кода
* [компонент](/guides/guides_v2-ru/yazykovye-modeli/ollama.md) - Более простое развертывание
* [Дообучение LLM](/guides/guides_v2-ru/obuchenie/finetune-llm.md) - Пользовательское обучение


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/deepseek-v3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
