> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md).

# DeepSeek V4 (1.6T MoE, мультимодальная)

Разверните DeepSeek V4 на Clore.ai — передовая MoE с лицензией MIT, обновлённая как Flash-0731 и Pro-0813

{% hint style="info" %}
**Статус (август 2026):** DeepSeek V4 впервые вышла **22 апреля 2026** под **MIT**, и с тех пор оба уровня были обновлены. Текущие чекпойнты: [deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) (**31 июля 2026**, 167 ГБ FP8, контекст 1M, подключён модуль speculative decoding) и [deepseek-ai/DeepSeek-V4-Pro-0813](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813) (**13 августа 2026**, 893 ГБ FP8, контекст 1M). Репозитории за апрель по-прежнему доступны как превью-версия.
{% endhint %}

## Что изменилось с апреля

|                         | Апрельский превью-релиз | Текущая                                                                                                                           |
| ----------------------- | ----------------------- | --------------------------------------------------------------------------------------------------------------------------------- |
| Flash                   | `DeepSeek-V4-Flash`     | **`DeepSeek-V4-Flash-0731`** — 167 ГБ FP8, 43 слоя, 256 экспертов (активны 6), контекст 1M, подключён DSpark speculative decoding |
| Pro                     | `DeepSeek-V4-Pro`       | **`DeepSeek-V4-Pro-0813`** — 893 ГБ FP8, 61 слой, 384 эксперта (активны 6), контекст 1M                                           |
| Управление рассуждением | —                       | `reasoning_effort`: `низкий`, `высокий`, `максимальный`                                                                           |
| Шаблон чата             | Jinja                   | **Шаблона Jinja нет.** В репозитории есть `encoding/` папка с Python-хелперами для построения промптов и разбора вывода           |

**Flash-0731 превосходит апрельский превью-релиз Pro** по собственным бенчмаркам DeepSeek, несмотря на долю активных параметров: Terminal-Bench 2.1 **82.7** (против 72.1), NL2Repo **54.2** (против 38.5), DeepSWE **54.4** (против 12.8), Toolathlon-Verified **70.3** (против 55.9). Это данные от производителя, измеренные собственным harness DeepSeek при `reasoning_effort: max`.

Если вы развернули апрельский превью-релиз, переход на `-0731` — это самое ценное изменение, которое вы можете сделать для развертывания DeepSeek прямо сейчас.

### Развёртывание Flash-0731 со speculative decoding

```bash
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \\
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \\
  --data-parallel-size 4 --enable-expert-parallel \\
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
```

{% hint style="warning" %}
**167 ГБ весов требует не карту, а сервер.** На маркетплейсе Clore.ai это означает 6× RTX 5090 (186 ГБ) или 8× RTX 4090 (192 ГБ) — 72 сервера с ≥167 ГБ, 26 свободны на последнем снимке. Квантизованные сборки GGUF уменьшают это ещё сильнее. Pro-0813 на 893 ГБ — это [голое железо](https://clore.ai/bare-metal) развёртывание.
{% endhint %}

DeepSeek V4 — первая open-weight фронтирная модель 2026 года, выпущенная как **двухуровневый релиз**. **V4-Pro** — флагманская версия — **Mixture-of-Experts с 1,6 трлн параметров** с примерно **49B активных параметров на токен**, а **контекстное окно на 1M токенов**, и гибридный дизайн внимания, сочетающий Compressed Sparse Attention с новой головой Heavily Compressed Attention для дешёвого длинноконтекстного prefill. **V4-Flash** — практичный собрат — **284B всего / 13B активных**, та же архитектура, помещается на одной 80GB GPU после квантизации и комфортно работает на 2×48GB машине со сборками Unsloth GGUF.

Архитектура — главная новость. Гибридное внимание DeepSeek резко снижает использование памяти KV-cache на длинном контексте, а роутер MoE был переобучен для более точного выбора экспертов — первые независимые прогоны показывают, что Pro достигает кодировочных результатов уровня V3 примерно при половине вычислений активных параметров. Для пользователей Clore.ai это важно, потому что **V4-Flash — это первый случай, когда фронтирная модель с активными параметрами менее 15B вышла с полными весами**, что делает серьёзный open inference доступным на одной H100 или на недорогой многокарточной сборке с 4090.

Для большинства команд реалистичное развёртывание на Clore — это **V4-Flash на 1× A100 80GB или 2× RTX 4090** — именно там лучшее соотношение цены и производительности. V4-Pro предназначен для серьёзной инфраструктуры: 8× H100, 4× H200 или 8× B200, в идеале с NVLink. Если вы уже запускали [DeepSeek V3](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v3.md) или [DeepSeek-R1](/guides/guides_v2-ru/yazykovye-modeli/deepseek-r1.md), путь миграции прост — та же семья моделей, тот же шаблон чата, замена в vLLM без доработок.

### Ключевые характеристики

| Параметр               | DeepSeek V4-Pro                                                                   | DeepSeek V4-Flash                                                                     |
| ---------------------- | --------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------- |
| Общее число параметров | 1.6T (MoE)                                                                        | 284B (MoE)                                                                            |
| Активные параметры     | \~49B на токен                                                                    | \~13B на токен                                                                        |
| Окно контекста         | 1 000 000 токенов                                                                 | 256 000 токенов                                                                       |
| Внимание               | Compressed Sparse + Heavily Compressed Attention                                  | Compressed Sparse + HCA                                                               |
| Лицензия               | MIT                                                                               | MIT                                                                                   |
| Дата выпуска           | 22 апреля 2026                                                                    | 22 апреля 2026                                                                        |
| HuggingFace            | [deepseek-ai/DeepSeek-V4-Pro](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro) | [deepseek-ai/DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) |
| Основные инструменты   | vLLM, SGLang (в день релиза)                                                      | vLLM, SGLang, llama.cpp (Unsloth GGUF)                                                |

### Зачем DeepSeek V4?

* **По-настоящему открытые фронтирные веса** — лицензия MIT, без ограничений на использование, полное коммерческое применение
* **1M контекст у Pro, 256K у Flash** — обрабатывает целые кодовые базы, книги или многочасовые транскрипты за один проход
* **Гибридное sparse attention** — KV cache растёт сублинейно на длинном контексте, prefill дешёвый
* **Двухуровневый релиз** — Flash — первая MoE-модель с 13B активных параметров, достаточно хорошая, чтобы заменить V3 в большинстве рабочих процессов
* **Поддержка vLLM и SGLang в день релиза** — не нужно ждать патчей от сообщества, просто `pip install -U` и вперёд
* **Эффективность MoE** — вы платите за инференс 13B/49B, а не 284B/1.6T

***

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

{% hint style="warning" %}
**V4-Pro — это фронтирная модель.** Полные веса BF16 занимают около 3.2 ТБ и требуют многонодовой H100/H200 или 8× B200 NVLink. Одноузлового пути BF16 нет. Если у вас нет многонодовой инфраструктуры, запускайте V4-Flash — это 80% качества за 5% стоимости оборудования.
{% endhint %}

| Компонент | Минимум (V4-Flash, GGUF Q4) | Рекомендуется (V4-Flash FP8)  | Полный V4-Pro (BF16)                            |
| --------- | --------------------------- | ----------------------------- | ----------------------------------------------- |
| VRAM GPU  | 1× 80GB или 2× 48GB         | 1× H100 80GB или 1× A100 80GB | 8× H100 80GB или 4× H200 141GB                  |
| ОЗУ       | 64GB                        | 128 ГБ                        | 1 ТБ+                                           |
| Диск      | 200 ГБ NVMe                 | 600 ГБ NVMe                   | 4 ТБ NVMe                                       |
| CUDA      | 12.8+                       | 12.8+                         | 12.8+                                           |
| Сеть      | —                           | —                             | NVLink / 400Gb IB для многонодовой конфигурации |

**Соответствие железу:** Для 95% пользователей, **V4-Flash в FP8 на карте класса 80GB** — это оптимум — полный контекст 256K, без потерь от квантизации, [голое железо](https://clore.ai/bare-metal) на маркетплейсе. Переходите на [H100](https://clore.ai/rent-h100.html) или [H200](https://clore.ai/rent-h200.html) tensor-parallel-конфигурации только если вам действительно нужен контекст V4-Pro в 1M или дополнительный запас для рассуждений.

***

## Вариант A — Ollama / GGUF (квантизированный, только V4-Flash)

Unsloth опубликовал GGUF-кванты для V4-Flash в течение 48 часов после релиза. Q4\_K\_M — это оптимум: помещается на 1× 80GB или 2× 48GB и сохраняет качество близким к FP8.

```bash
# Скачать сборку Unsloth Q4_K_M
docker exec ollama ollama pull hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M
docker exec ollama ollama run hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M

# Или через llama.cpp напрямую на загруженном GGUF
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/DeepSeek-V4-Flash-Q4_K_M.gguf \\
  --n-gpu-layers 99 --ctx-size 65536 \\
  --port 8080 --host 0.0.0.0
```

{% hint style="info" %}
GGUF-кванты для V4-**Pro** существуют, но непрактичны — даже Q2\_K занимает около 400 ГБ, а производительность выгрузки непригодна для чата. Для квантизированных развёртываний используйте Flash.
{% endhint %}

***

## Вариант B — vLLM (production API, рекомендуется)

vLLM 0.7.x добавил поддержку обоих V4-чекпойнтов в день релиза. Ядрам гибридного внимания нужны `--trust-remote-code` и железо Hopper или Blackwell для полной скорости.

**V4-Flash на одном H100 / A100 80GB:**

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model deepseek-ai/DeepSeek-V4-Flash
      --tensor-parallel-size 1
      --max-model-len 131072
      --dtype bfloat16
      --gpu-memory-utilization 0.92
      --enable-chunked-prefill
      --served-model-name deepseek-v4-flash
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

**V4-Pro на 8× H100 80GB:** замените команду на:

```yaml
    command: >
      --model deepseek-ai/DeepSeek-V4-Pro
      --tensor-parallel-size 8
      --max-model-len 262144
      --dtype bfloat16
      --gpu-memory-utilization 0.90
      --enable-chunked-prefill
      --enable-prefix-caching
      --served-model-name deepseek-v4-pro
      --trust-remote-code
```

```bash
# Проверить API
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{"role": "user", "content": "Напишите async TCP echo server на Rust с graceful shutdown."}],
    "max_tokens": 2048,
    "temperature": 0.6
  }'
```

{% hint style="info" %}
Начните с `--max-model-len 131072` даже если в итоге вам нужен полный контекст 1M — длинные контексты резко увеличивают время prefill и объём KV-памяти. Увеличивайте его только после того, как базовая версия стабильно работает.
{% endhint %}

***

## Вариант C — SGLang (альтернатива, часто быстрее на Hopper)

RadixAttention и prefix caching от SGLang хорошо сочетаются с гибридным вниманием V4 — для агентных нагрузок с общими промптами ожидайте заметно более высокий tok/s, чем у vLLM.

```bash
docker pull lmsysorg/sglang:latest

# V4-Flash на 1× H100/A100
python3 -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-V4-Flash \\
  --tp-size 1 \
  --context-length 131072 \
  --mem-fraction-static 0.90 \\
  --enable-torch-compile \\
  --served-model-name deepseek-v4-flash \\
  --trust-remote-code

# V4-Pro на 8× H100
python3 -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-V4-Pro \\
  --tp-size 8 \
  --context-length 262144 \\
  --mem-fraction-static 0.88 \\
  --enable-torch-compile \\
  --served-model-name deepseek-v4-pro \\
  --trust-remote-code
```

SGLang `--enable-torch-compile` обычно добавляет ещё 10–20% пропускной способности на Hopper после первоначального прогрева.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация                                                | Модель                                 | VRAM        | Ожидаемая производительность                            | Стоимость на Clore.ai                       |
| ----------------------------------------------------------- | -------------------------------------- | ----------- | ------------------------------------------------------- | ------------------------------------------- |
| 2× [RTX 4090](https://clore.ai/rent-4090.html) (Q4 GGUF)    | V4-Flash                               | 48 ГБ       | Хобби-использование, один поток                         | $0.14–0.42/ч                                |
| 1× [A100 80 ГБ](https://clore.ai/rent-a100-80gb.html) (FP8) | V4-Flash                               | 80 ГБ       | Надёжный production для одного арендатора               | [голое железо](https://clore.ai/bare-metal) |
| 1× RTX 5090 32GB (Q4 GGUF, частичная выгрузка)              | V4-Flash                               | 32 ГБ + RAM | Ограничено, только для разработки                       | $0.25–0.77/ч в пике                         |
| 4× [H100 80GB](https://clore.ai/rent-h100.html)             | V4-Flash FP8 (избыточно) или V4-Pro Q4 | 320 ГБ      | Flash для нескольких арендаторов, Pro для одного потока | \~$1.04/ч                                   |
| 8× [H100 80GB](https://clore.ai/rent-h100.html)             | V4-Pro BF16                            | 640 ГБ      | Промышленный фронтирный инференс                        | \~$1.04/ч                                   |
| 4× [H200 141GB](https://clore.ai/rent-h200.html)            | V4-Pro BF16 + контекст 1M              | 564 ГБ      | Полный контекст 1M, максимальная пропускная способность | [голое железо](https://clore.ai/bare-metal) |

{% hint style="success" %}
**Лучшее соотношение цены и качества на Clore.ai:** 1× A100 80GB с V4-Flash FP8. Вы получаете контекст 256K, стоимость инференса как примерно для 13B активных параметров, без потерь от квантизации, и счёт примерно равен цене подписки Claude Sonnet API — при этом веса остаются у вас на сервере.
{% endhint %}

***

## Сценарии использования

* **Рассуждения по всей кодовой базе** — контекст 1M у V4-Pro помещает типичный монорепозиторий на 500K LOC плюс тесты в один промпт
* **Длинный RAG** — загружайте в контекст целые книги, судебные документы или годовые отчёты, пропуская пайплайн нарезки
* **Агентное кодирование** — V4-Flash соответствует V3 на SWE-Bench при доле стоимости инференса; сочетайте с SWE-agent или OpenHands
* **Синтез из нескольких документов** — исследовательские рабочие процессы, для которых раньше требовался Gemini 2.5 Pro, теперь работают на вашем собственном оборудовании
* **Самостоятельно размещаемая замена Cursor / Copilot** — V4-Flash на одном A100 загружает команду из 5 разработчиков
* **Основа для fine-tuning** — лицензия MIT + чистая архитектура MoE делают её отличной отправной точкой для доменных fine-tune

***

## Бенчмарки

{% hint style="warning" %}
**Утверждения вендора — проверяйте независимо.** Ниже приведённые числа взяты из анонса DeepSeek от 22 апреля 2026 года и model card. Независимые воспроизведения всё ещё публикуются; воспринимайте это как ориентир, а не истину в последней инстанции.
{% endhint %}

| Бенчмарк                                 | V4-Pro | V4-Flash | DeepSeek V3 | GLM-5.1 |
| ---------------------------------------- | ------ | -------- | ----------- | ------- |
| MMLU-Pro                                 | \~84%  | \~78%    | \~76%       | \~80%   |
| SWE-Bench Verified                       | \~82%  | \~74%    | \~70%       | \~79%   |
| HumanEval                                | \~96%  | \~92%    | \~91%       | \~94%   |
| MATH-500                                 | \~94%  | \~88%    | \~85%       | \~90%   |
| LiveCodeBench                            | \~76%  | \~68%    | \~62%       | \~72%   |
| Длинный контекст (1M needle-in-haystack) | \~98%  | н/д      | н/д         | н/д     |

Для сопоставимого сравнения open-weight см. [гайд по GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — V4-Pro и GLM-5.1 по-разному ведут себя в зависимости от бенчмарка.

***

## Устранение неполадок

| Проблема                                     | Решение                                                                                                                                                                                                                 |
| -------------------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` загрузка V4-Pro на 8×H100 | BF16 требует около 3.2 ТБ — Pro не поместится на одном узле 8×H100. Используйте 4× H200 141GB или многонодовую конфигурацию.                                                                                            |
| `неподдерживаемый backend внимания`          | V4 требует vLLM ≥ 0.7.0 или SGLang ≥ 0.4.4. Запустите `pip install -U vllm` (или извлеките `:latest` Docker-образ).                                                                                                     |
| Медленная загрузка с HuggingFace             | Используйте `huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download`. Pro — около 3.2 ТБ; Flash — около 570 ГБ.                                                                 |
| `--trust-remote-code` отклонено              | Модули гибридного внимания поставляются как пользовательский код в репозитории — `--trust-remote-code` требуется для обоих движков, пока ядра не попадут в upstream Transformers.                                       |
| GGUF Q4 выдаёт бессмыслицу                   | Убедитесь, что вы используете сборку Unsloth (`unsloth/DeepSeek-V4-Flash-GGUF`), а не ранний квантизационный вариант от сообщества. Роутеру MoE нужна специальная обработка, которую ранние кванты реализовали неверно. |
| OOM по контексту 1M у V4-Pro                 | Понизьте до `--max-model-len 262144` и добавьте `--enable-prefix-caching`. Для настоящего обслуживания 1M нужен H200 или B200.                                                                                          |
| Медленный prefill на длинном контексте       | Это ожидаемо — даже с гибридным вниманием prefill для 500K+ занимает минуты, а не секунды. Используйте `--enable-chunked-prefill` и prefix caching для амортизации.                                                     |

***

## Дальнейшие шаги

* **Предшественник:** [DeepSeek V3](/guides/guides_v2-ru/yazykovye-modeli/deepseek-v3.md) — модель, которую V4-Flash фактически заменяет
* **Собрат по рассуждениям:** [DeepSeek-R1](/guides/guides_v2-ru/yazykovye-modeli/deepseek-r1.md) — настроен на chain-of-thought, всё ещё полезен для задач с интенсивной математикой
* **Открытая альтернатива:** [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — 744B MoE, лидер SWE-Bench Pro, сопоставимое соотношение цены и производительности
* **Мультимодальная альтернатива:** [Qwen3.5-Omni](/guides/guides_v2-ru/yazykovye-modeli/qwen35-omni.md) — если вам нужны vision/audio в одной модели
* **Арендуйте железо:** [Маркетплейс Clore.ai](https://clore.ai/marketplace) — H100/H200/A100/RTX 4090 от $0.14–0.42/ч

### Ссылки

* [DeepSeek-V4-Pro на HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)
* [DeepSeek-V4-Flash на HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash)
* [GGUF-кванты Unsloth для V4-Flash](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF)
* [GitHub DeepSeek](https://github.com/deepseek-ai)
* [Документация vLLM](https://docs.vllm.ai)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
