> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/deepseek-v4.md).

# DeepSeek V4 (MoE 1,6T, multimodal)

Déployez DeepSeek V4 sur Clore.ai — le MoE frontière sous licence MIT, actualisé en Flash-0731 et Pro-0813

{% hint style="info" %}
**Statut (août 2026) :** DeepSeek V4 a été lancé pour la première fois le **22 avril 2026** sous **MIT**, et les deux niveaux ont depuis été actualisés. Les points de contrôle actuels sont [deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) (**31 juillet 2026**, 167 Go FP8, contexte 1 M, module de décodage spéculatif attaché) et [deepseek-ai/DeepSeek-V4-Pro-0813](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813) (**13 août 2026**, 893 Go FP8, contexte 1 M). Les dépôts d'avril restent en ligne comme génération d'aperçu.
{% endhint %}

## Ce qui a changé depuis avril

|                          | Aperçu d'avril      | Actuel                                                                                                                                        |
| ------------------------ | ------------------- | --------------------------------------------------------------------------------------------------------------------------------------------- |
| Flash                    | `DeepSeek-V4-Flash` | **`DeepSeek-V4-Flash-0731`** — 167 Go FP8, 43 couches, 256 experts (6 actifs), contexte 1 M, décodage spéculatif DSpark attaché               |
| Pro                      | `DeepSeek-V4-Pro`   | **`DeepSeek-V4-Pro-0813`** — 893 Go FP8, 61 couches, 384 experts (6 actifs), contexte 1 M                                                     |
| Contrôle du raisonnement | —                   | `reasoning_effort`: `faible`, `élevé`, `maximum`                                                                                              |
| Modèle de conversation   | Jinja               | **Aucun modèle Jinja.** Le dépôt inclut un `encoding/` dossier contenant des helpers Python pour construire les prompts et analyser la sortie |

**Flash-0731 surpasse l'aperçu Pro d'avril** sur les propres benchmarks de DeepSeek malgré une fraction des paramètres actifs : Terminal-Bench 2.1 **82.7** (contre 72.1), NL2Repo **54.2** (contre 38.5), DeepSWE **54.4** (contre 12.8), Toolathlon-Verified **70.3** (contre 55.9). Ce sont des chiffres fournis par l'éditeur, mesurés avec le propre banc d'essai de DeepSeek à `reasoning_effort: max`.

Si vous avez déployé l'aperçu d'avril, passer à `-0731` est le changement le plus rentable que vous puissiez apporter à un déploiement DeepSeek en ce moment.

### Diffuser Flash-0731 avec décodage spéculatif

```bash
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \\
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \\
  --data-parallel-size 4 --enable-expert-parallel \\
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
```

{% hint style="warning" %}
**167 Go de poids nécessitent une machine, pas une carte.** Sur la place de marché Clore.ai, cela signifie 6× RTX 5090 (186 Go) ou 8× RTX 4090 (192 Go) — 72 serveurs listés à ≥167 Go, 26 libres lors du dernier instantané. Les builds GGUF quantifiés réduisent encore cela. Pro-0813 à 893 Go est un [bare metal](https://clore.ai/bare-metal) déploiement.
{% endhint %}

DeepSeek V4 est le premier modèle de pointe open-weight de 2026 à être publié sous forme de **publication en deux niveaux**. **V4-Pro** est le modèle phare — un **Mixture-of-Experts de 1,6 trillion de paramètres** avec environ **49B de paramètres actifs par jeton**, un **fenêtre de contexte d’1M de jetons**, et une conception d'attention hybride qui combine Compressed Sparse Attention avec une nouvelle tête Heavily Compressed Attention pour un préremplissage peu coûteux à long contexte. **V4-Flash** est le frère pratique — **284B au total / 13B actifs**, la même architecture, tient sur un seul GPU de 80 Go une fois quantifiée, et fonctionne confortablement sur une machine 2×48 Go avec des builds GGUF Unsloth.

L'architecture est le point fort. L'attention hybride de DeepSeek réduit considérablement la mémoire du cache KV à long contexte, et le routeur MoE a été réentraîné pour une sélection d'experts plus précise — les premiers essais indépendants indiquent que Pro atteint des scores de codage de niveau V3 pour environ la moitié du calcul en paramètres actifs. Pour les utilisateurs de Clore.ai, c'est important car **V4-Flash est la première fois qu'un modèle de pointe à moins de 15B actifs est livré avec ses poids complets**, rendant une inférence ouverte sérieuse accessible avec un seul H100 ou une machine multi-4090 bon marché.

Pour la plupart des équipes, le déploiement réaliste sur Clore est **V4-Flash sur 1× A100 80 Go ou 2× RTX 4090** — c'est là que se trouve le meilleur rapport prix/performance. V4-Pro est réservé à une infrastructure sérieuse : 8× H100, 4× H200 ou 8× B200, idéalement avec NVLink. Si vous faisiez tourner [DeepSeek V3](/guides/guides_v2-fr/modeles-de-langage/deepseek-v3.md) ou [DeepSeek-R1](/guides/guides_v2-fr/modeles-de-langage/deepseek-r1.md), le chemin de migration est simple — même famille de modèles, même modèle de conversation, remplacement direct dans vLLM.

### Spécifications clés

| Propriété           | DeepSeek V4-Pro                                                                   | DeepSeek V4-Flash                                                                     |
| ------------------- | --------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------- |
| Paramètres totaux   | 1.6T (MoE)                                                                        | 284B (MoE)                                                                            |
| Paramètres actifs   | \~49B par jeton                                                                   | \~13B par jeton                                                                       |
| Fenêtre de contexte | 1 000 000 de tokens                                                               | 256 000 jetons                                                                        |
| Attention           | Compressed Sparse + Heavily Compressed Attention                                  | Compressed Sparse + HCA                                                               |
| Licence             | MIT                                                                               | MIT                                                                                   |
| Date de sortie      | 22 avril 2026                                                                     | 22 avril 2026                                                                         |
| HuggingFace         | [deepseek-ai/DeepSeek-V4-Pro](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro) | [deepseek-ai/DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) |
| Outils principaux   | vLLM, SGLang (dès le premier jour)                                                | vLLM, SGLang, llama.cpp (GGUF Unsloth)                                                |

### Pourquoi DeepSeek V4 ?

* **Poids de pointe véritablement ouverts** — licence MIT, aucune restriction d'utilisation, utilisation commerciale complète
* **contexte 1 M sur Pro, 256K sur Flash** — gère des bases de code entières, des livres ou des transcriptions d'une heure en un seul passage
* **Attention clairsemée hybride** — le cache KV évolue de manière sous-linéaire à long contexte, le préremplissage est peu coûteux
* **Publication en deux niveaux** — Flash est le premier MoE à 13B actifs suffisamment bon pour remplacer V3 dans la plupart des flux de travail
* **Prise en charge vLLM et SGLang dès le jour 0** — pas besoin d'attendre des correctifs communautaires, il suffit de `pip install -U` et c'est parti
* **Efficacité MoE** — vous payez le coût d'inférence de 13B/49B, pas celui de 284B/1.6T

***

## Exigences

{% hint style="warning" %}
**Les configurations multi-GPU de classe 80 Go ne sont pas répertoriées sur la place de marché Clore.ai.** Les plus grosses machines répertoriées aujourd’hui sont 4× RTX PRO 6000 Blackwell (96 Go chacune, 380 Go au total) et 8–11× RTX 5090 (32 Go chacune). La capacité A100 / H200 / B200 est proposée en bare metal sur demande. Consultez [bare metal](https://clore.ai/bare-metal) sur demande. Consultez [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md) avant de dimensionner un déploiement.
{% endhint %}

{% hint style="warning" %}
**V4-Pro est un modèle de pointe.** Les poids BF16 complets font environ 3,2 To et nécessitent des H100/H200 multi-nœuds ou 8× B200 NVLink. Il n'existe pas de voie BF16 sur un seul serveur. Si vous n'avez pas d'infrastructure multi-nœuds, lancez V4-Flash — c'est 80 % de la qualité pour 5 % du coût matériel.
{% endhint %}

| Composant | Minimum (V4-Flash, GGUF Q4) | Recommandé (V4-Flash FP8)      | V4-Pro complet (BF16)                  |
| --------- | --------------------------- | ------------------------------ | -------------------------------------- |
| VRAM GPU  | 1× 80 Go ou 2× 48 Go        | 1× H100 80 Go ou 1× A100 80 Go | 8× H100 80 Go ou 4× H200 141 Go        |
| RAM       | 64 Go                       | 128 Go                         | 1 To+                                  |
| Disque    | 200 Go NVMe                 | 600 Go NVMe                    | 4 To NVMe                              |
| CUDA      | 12.8+                       | 12.8+                          | 12.8+                                  |
| Réseau    | —                           | —                              | NVLink / IB 400 Gb pour le multi-nœuds |

**Adéquation matérielle :** Pour 95 % des utilisateurs, **V4-Flash en FP8 sur une carte de classe 80 Go** est le meilleur compromis — contexte complet de 256 K, aucune perte due à la quantification, [bare metal](https://clore.ai/bare-metal) sur la place de marché. Tournez-vous vers [H100](https://clore.ai/rent-h100.html) ou [H200](https://clore.ai/rent-h200.html) les configurations tensor-parallèles uniquement lorsque vous avez réellement besoin du contexte 1 M de V4-Pro ou de la marge de raisonnement supplémentaire.

***

## Option A — Ollama / GGUF (quantifié, V4-Flash uniquement)

Unsloth a publié des quants GGUF pour V4-Flash dans les 48 heures suivant la sortie. Q4\_K\_M est le meilleur compromis — tient sur 1× 80 Go ou 2× 48 Go et conserve une qualité proche de FP8.

```bash
# Récupérer la build Q4_K_M d'Unsloth
docker exec ollama ollama pull hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M
docker exec ollama ollama run hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M

# Ou avec llama.cpp directement sur un GGUF téléchargé
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/DeepSeek-V4-Flash-Q4_K_M.gguf \\
  --n-gpu-layers 99 --ctx-size 65536 \\
  --port 8080 --host 0.0.0.0
```

{% hint style="info" %}
Les quants GGUF pour V4-**Pro** existent mais ne sont pas pratiques — même Q2\_K fait environ 400 Go et les performances de déchargement sont inutilisables pour le chat. Restez sur Flash pour les déploiements quantifiés.
{% endhint %}

***

## Option B — vLLM (API de production, recommandé)

vLLM 0.7.x a ajouté la prise en charge dès le premier jour des deux points de contrôle V4. Les kernels d'attention hybride nécessitent `--trust-remote-code` et du matériel Hopper ou Blackwell pour la pleine vitesse.

**V4-Flash sur un seul H100 / A100 80 Go :**

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model deepseek-ai/DeepSeek-V4-Flash
      --tensor-parallel-size 1
      --max-model-len 131072
      --dtype bfloat16
      --gpu-memory-utilization 0.92
      --enable-chunked-prefill
      --served-model-name deepseek-v4-flash
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

**V4-Pro sur 8× H100 80 Go :** remplacez la commande par :

```yaml
    command: >
      --model deepseek-ai/DeepSeek-V4-Pro
      --tensor-parallel-size 8
      --max-model-len 262144
      --dtype bfloat16
      --gpu-memory-utilization 0.90
      --enable-chunked-prefill
      --enable-prefix-caching
      --served-model-name deepseek-v4-pro
      --trust-remote-code
```

```bash
# Tester l'API
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{"role": "user", "content": "Écrivez un serveur d'écho TCP asynchrone en Rust avec arrêt gracieux."}],
    "max_tokens": 2048,
    "temperature": 0.6
  }'
```

{% hint style="info" %}
Commencez par `--max-model-len 131072` même si vous voulez au final le contexte complet de 1 M — les contextes longs augmentent énormément le temps de préremplissage et la mémoire KV. Augmentez-le uniquement une fois la base stable.
{% endhint %}

***

## Option C — SGLang (alternative, souvent plus rapide sur Hopper)

RadixAttention de SGLang et la mise en cache des préfixes se marient bien avec l'attention hybride de V4 — pour des charges agentiques avec des prompts partagés, attendez-vous à un nombre de tok/s nettement supérieur à celui de vLLM.

```bash
docker pull lmsysorg/sglang:latest

# V4-Flash sur 1× H100/A100
python3 -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-V4-Flash \\
  --tp-size 1 \
  --context-length 131072 \
  --mem-fraction-static 0.90 \\
  --enable-torch-compile \\
  --served-model-name deepseek-v4-flash \\
  --trust-remote-code

# V4-Pro sur 8× H100
python3 -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-V4-Pro \\
  --tp-size 8 \
  --context-length 262144 \\
  --mem-fraction-static 0.88 \\
  --enable-torch-compile \\
  --served-model-name deepseek-v4-pro \\
  --trust-remote-code
```

de SGLang `--enable-torch-compile` ajoute généralement encore 10 à 20 % de débit sur Hopper après le préchauffage initial.

***

## Recommandations GPU Clore.ai

| Configuration                                               | Modèle                                     | VRAM        | Débit attendu                            | Coût Clore.ai                             |
| ----------------------------------------------------------- | ------------------------------------------ | ----------- | ---------------------------------------- | ----------------------------------------- |
| 2× [RTX 4090](https://clore.ai/rent-4090.html) (Q4 GGUF)    | V4-Flash                                   | 48GB        | Usage amateur, flux unique               | 0,14–0,42 $/h                             |
| 1× [A100 80 Go](https://clore.ai/rent-a100-80gb.html) (FP8) | V4-Flash                                   | 80 Go       | Production solide à locataire unique     | [bare metal](https://clore.ai/bare-metal) |
| 1× RTX 5090 32 Go (Q4 GGUF, déchargement partiel)           | V4-Flash                                   | 32 Go + RAM | Contraint, développement uniquement      | 0,25–0,77 $/h au pic                      |
| 4× [H100 80 Go](https://clore.ai/rent-h100.html)            | V4-Flash FP8 (surdimensionné) ou V4-Pro Q4 | 320 Go      | Flash multi-locataire, Pro à flux unique | \~1,04 $/h                                |
| 8× [H100 80 Go](https://clore.ai/rent-h100.html)            | V4-Pro BF16                                | 640 Go      | Inférence de pointe en production        | \~1,04 $/h                                |
| 4× [H200 141 Go](https://clore.ai/rent-h200.html)           | V4-Pro BF16 + contexte 1 M                 | 564 Go      | Contexte complet 1 M, débit maximal      | [bare metal](https://clore.ai/bare-metal) |

{% hint style="success" %}
**Meilleur rapport qualité-prix sur Clore.ai :** 1× A100 80 Go exécutant V4-Flash FP8. Vous obtenez un contexte 256 K, un coût d'inférence actif d'environ 13B, aucune perte de quantification, et la facture correspond à peu près au prix d'un abonnement à l'API Claude Sonnet — avec des poids qui restent sur votre machine.
{% endhint %}

***

## Cas d’usage

* **Raisonnement sur toute la base de code** — le contexte 1 M de V4-Pro tient dans un monorepo typique de 500K lignes de code plus ses tests dans un seul prompt
* **RAG longue forme** — mettez des livres entiers, des dépôts juridiques ou des rapports annuels dans le contexte, et évitez le pipeline de découpage
* **Codage agentique** — V4-Flash égale V3 sur SWE-Bench pour une fraction du coût d'inférence ; associez-le à SWE-agent ou OpenHands
* **Synthèse multi-documents** — les workflows de recherche qui nécessitaient auparavant Gemini 2.5 Pro s'exécutent désormais sur votre propre matériel
* **Remplacement auto-hébergé de Cursor / Copilot** — V4-Flash sur un seul A100 suffit à saturer une équipe de 5 développeurs
* **Base de fine-tuning** — licence MIT + architecture MoE propre en font un excellent point de départ pour des fine-tunes de domaine

***

## Benchmarks

{% hint style="warning" %}
**Déclaré par le fournisseur — vérifiez indépendamment.** Les chiffres ci-dessous proviennent de l'annonce de DeepSeek du 22 avril 2026 et de la fiche modèle. Des reproductions indépendantes sont encore publiées ; considérez-les comme indicatives, pas comme une vérité absolue.
{% endhint %}

| Benchmark                                             | V4-Pro | V4-Flash | DeepSeek V3 | GLM-5.1 |
| ----------------------------------------------------- | ------ | -------- | ----------- | ------- |
| MMLU-Pro                                              | \~84%  | \~78%    | \~76%       | \~80%   |
| SWE-Bench Verified                                    | \~82%  | \~74%    | \~70%       | \~79%   |
| HumanEval                                             | \~96%  | \~92%    | \~91%       | \~94%   |
| MATH-500                                              | \~94%  | \~88%    | \~85%       | \~90%   |
| LiveCodeBench                                         | \~76%  | \~68%    | \~62%       | \~72%   |
| Long contexte (aiguille dans une botte de foin à 1 M) | \~98%  | n/d      | n/d         | n/d     |

Pour une comparaison open-weight équivalente, consultez le [guide GLM-5.1](/guides/guides_v2-fr/modeles-de-langage/glm-5-1.md) — V4-Pro et GLM-5.1 se rendent coup pour coup selon le benchmark.

***

## Dépannage

| Problème                                           | Solution                                                                                                                                                                                                                     |
| -------------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` chargement de V4-Pro sur 8×H100 | Le BF16 nécessite environ 3,2 To — vous ne pouvez pas faire tenir Pro sur un seul nœud 8×H100. Utilisez 4× H200 141 Go ou du multi-nœuds.                                                                                    |
| `backend d'attention non pris en charge`           | V4 nécessite vLLM ≥ 0.7.0 ou SGLang ≥ 0.4.4. Exécutez `pip install -U vllm` (ou récupérez `:latest` image Docker).                                                                                                           |
| Téléchargement HuggingFace lent                    | Utilisez `huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download`. Pro fait environ 3,2 To ; Flash environ 570 Go.                                                                   |
| `--trust-remote-code` refusé                       | Les modules d'attention hybride sont fournis comme code personnalisé dans le dépôt — `--trust-remote-code` est requis pour les deux moteurs jusqu'à ce que les kernels arrivent dans Transformers en amont.                  |
| Les sorties GGUF Q4 sont du charabia               | Assurez-vous d'utiliser la build Unsloth (`unsloth/DeepSeek-V4-Flash-GGUF`), et non une première quantification communautaire. Le routeur MoE nécessite une prise en charge spéciale que les premières quants ont mal gérée. |
| OOM avec un contexte 1 M sur V4-Pro                | Descendez à `--max-model-len 262144` et ajoutez `--enable-prefix-caching`. Un service 1 M réel nécessite H200 ou B200.                                                                                                       |
| Préremplissage lent à long contexte                | C'est attendu — même avec l'attention hybride, un préremplissage de 500K+ prend des minutes, pas des secondes. Utilisez `--enable-chunked-prefill` et la mise en cache de préfixe pour amortir.                              |

***

## Étapes suivantes

* **Prédécesseur :** [DeepSeek V3](/guides/guides_v2-fr/modeles-de-langage/deepseek-v3.md) — le modèle V4-Flash remplace effectivement
* **Frère orienté raisonnement :** [DeepSeek-R1](/guides/guides_v2-fr/modeles-de-langage/deepseek-r1.md) — optimisé pour le chain-of-thought, toujours utile pour les flux de travail très mathématiques
* **Alternative à poids ouverts :** [GLM-5.1](/guides/guides_v2-fr/modeles-de-langage/glm-5-1.md) — MoE de 744B, au sommet de SWE-Bench Pro, rapport prix/performance comparable
* **Alternative multimodale :** [Qwen3.5-Omni](/guides/guides_v2-fr/modeles-de-langage/qwen35-omni.md) — si vous avez besoin de vision/audio dans le même modèle
* **Louez le matériel :** [Marketplace Clore.ai](https://clore.ai/marketplace) — H100/H200/A100/RTX 4090 à partir de 0,14–0,42 $/h

### Liens

* [DeepSeek-V4-Pro sur HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)
* [DeepSeek-V4-Flash sur HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash)
* [Quants GGUF V4-Flash d'Unsloth](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF)
* [GitHub de DeepSeek](https://github.com/deepseek-ai)
* [documentation vLLM](https://docs.vllm.ai)
* [dépôt SGLang](https://github.com/sgl-project/sglang)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
