> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v4.md).

# DeepSeek V4 (1.6T MoE, multimodal)

Despliega DeepSeek V4 en Clore.ai: el MoE frontier con licencia MIT, actualizado como Flash-0731 y Pro-0813

{% hint style="info" %}
**Estado (agosto de 2026):** DeepSeek V4 se lanzó por primera vez el **22 de abril de 2026** bajo **MIT**, y ambos niveles se han actualizado desde entonces. Los checkpoints actuales son [deepseek-ai/DeepSeek-V4-Flash-0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) (**31 de julio de 2026**, 167 GB FP8, 1M de contexto, módulo de decodificación especulativa adjunto) y [deepseek-ai/DeepSeek-V4-Pro-0813](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813) (**13 de agosto de 2026**, 893 GB FP8, 1M de contexto). Los repos de abril siguen disponibles como la generación de vista previa.
{% endhint %}

## Qué cambió desde abril

|                          | Vista previa de abril | Actual                                                                                                                                        |
| ------------------------ | --------------------- | --------------------------------------------------------------------------------------------------------------------------------------------- |
| Flash                    | `DeepSeek-V4-Flash`   | **`DeepSeek-V4-Flash-0731`** — 167 GB FP8, 43 capas, 256 expertos (6 activos), 1M de contexto, con decodificación especulativa DSpark adjunta |
| Pro                      | `DeepSeek-V4-Pro`     | **`DeepSeek-V4-Pro-0813`** — 893 GB FP8, 61 capas, 384 expertos (6 activos), 1M de contexto                                                   |
| Control del razonamiento | —                     | `reasoning_effort`: `bajo`, `alto`, `máximo`                                                                                                  |
| Plantilla de chat        | Jinja                 | **No hay plantilla Jinja.** El repositorio incluye un `encoding/` carpeta con ayudantes de Python para construir prompts y analizar la salida |

**Flash-0731 supera la vista previa Pro de abril** en los propios benchmarks de DeepSeek a pesar de tener una fracción de los parámetros activos: Terminal-Bench 2.1 **82.7** (frente a 72.1), NL2Repo **54.2** (frente a 38.5), DeepSWE **54.4** (frente a 12.8), Toolathlon-Verified **70.3** (frente a 55.9). Esos son datos reportados por el proveedor, medidos con el propio entorno de DeepSeek en `reasoning_effort: máximo`.

Si implementaste la vista previa de abril, cambiar a `-0731` es el cambio individual de mayor valor que puedes hacer ahora mismo en una implementación de DeepSeek.

### Sirviendo Flash-0731 con decodificación especulativa

```bash
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
```

{% hint style="warning" %}
**167 GB de pesos necesita un equipo, no una sola tarjeta.** En el mercado de Clore.ai eso significa 6× RTX 5090 (186 GB) o 8× RTX 4090 (192 GB) — 72 servidores listados con ≥167 GB, 26 libres en la última captura. Las compilaciones GGUF cuantizadas lo reducen aún más. Pro-0813 con 893 GB es una [bare metal](https://clore.ai/bare-metal) implementación.
{% endhint %}

DeepSeek V4 es el primer modelo de frontera de pesos abiertos de 2026 en lanzarse como una **lanzamiento de dos niveles**. **V4-Pro** es el buque insignia — un **Mixture-of-Experts de 1,6 billones de parámetros** con aproximadamente **49B parámetros activos por token**, un **ventana de contexto de 1M tokens**, y un diseño de atención híbrida que combina Compressed Sparse Attention con una nueva cabeza Heavily Compressed Attention para un prefill barato de largo contexto. **V4-Flash** es el hermano práctico — **284B total / 13B activos**, la misma arquitectura, cabe en una sola GPU de 80GB cuando se cuantiza, y funciona cómodamente en una caja de 2×48GB con compilaciones Unsloth GGUF.

La arquitectura es la noticia principal. La atención híbrida de DeepSeek reduce drásticamente la memoria de la KV-cache en contexto largo, y el router MoE ha sido reentrenado para una selección de expertos más precisa — las primeras ejecuciones independientes informan que Pro alcanza puntuaciones de codificación del nivel de V3 con aproximadamente la mitad del cómputo de parámetros activos. Para los usuarios de Clore.ai esto importa porque **V4-Flash es la primera vez que un modelo de frontera con menos de 15B parámetros activos se lanza con pesos completos**, poniendo la inferencia abierta seria al alcance de una sola H100 o de una caja barata con varias RTX 4090.

Para la mayoría de los equipos, la implementación realista en Clore es **V4-Flash en 1× A100 80GB o 2× RTX 4090** — ahí es donde vive la mejor relación precio-rendimiento. V4-Pro queda reservado para infraestructura seria: 8× H100, 4× H200 o 8× B200, idealmente con NVLink. Si has estado ejecutando [DeepSeek V3](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v3.md) o [DeepSeek-R1](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-r1.md), la ruta de migración es sencilla — misma familia de modelos, misma plantilla de chat, reemplazo directo en vLLM.

### Especificaciones clave

| Propiedad                | DeepSeek V4-Pro                                                                   | DeepSeek V4-Flash                                                                     |
| ------------------------ | --------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------- |
| Parámetros totales       | 1.6T (MoE)                                                                        | 284B (MoE)                                                                            |
| Parámetros activos       | \~49B por token                                                                   | \~13B por token                                                                       |
| Ventana de contexto      | 1.000.000 tokens                                                                  | 256.000 tokens                                                                        |
| Atención                 | Atención dispersa comprimida + Atención fuertemente comprimida                    | Atención dispersa comprimida + HCA                                                    |
| Licencia                 | MIT                                                                               | MIT                                                                                   |
| Fecha de lanzamiento     | 22 de abril de 2026                                                               | 22 de abril de 2026                                                                   |
| HuggingFace              | [deepseek-ai/DeepSeek-V4-Pro](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro) | [deepseek-ai/DeepSeek-V4-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash) |
| Herramientas principales | vLLM, SGLang (día 0)                                                              | vLLM, SGLang, llama.cpp (GGUF de Unsloth)                                             |

### ¿Por qué DeepSeek V4?

* **Pesos de frontera verdaderamente abiertos** — licencia MIT, sin restricciones de uso, uso comercial completo
* **1M de contexto en Pro, 256K en Flash** — maneja bases de código completas, libros o transcripciones de horas en una sola pasada
* **Atención dispersa híbrida** — la KV cache crece sublinealmente en contexto largo, el prefill es barato
* **Lanzamiento de dos niveles** — Flash es el primer MoE con 13B activos lo bastante bueno para reemplazar V3 en la mayoría de los flujos de trabajo
* **Compatibilidad con vLLM y SGLang desde el día 0** — no hace falta esperar parches de la comunidad, solo `pip install -U` y listo
* **Eficiencia MoE** — pagas el coste de inferencia de 13B/49B, no de 284B/1.6T

***

## Requisitos

{% hint style="warning" %}
**Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai.** Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como [bare metal](https://clore.ai/bare-metal) bajo pedido. Consulta [Precios y disponibilidad de GPU](/guides/guides_v2-es/primeros-pasos/pricing.md) antes de dimensionar un despliegue.
{% endhint %}

{% hint style="warning" %}
**V4-Pro es un modelo de frontera.** Los pesos BF16 completos son \~3.2TB y requieren H100/H200 multinodo o 8× B200 NVLink. No existe una ruta BF16 de un solo servidor. Si no tienes infraestructura multinodo, ejecuta V4-Flash — ofrece el 80% de la calidad al 5% del coste de hardware.
{% endhint %}

| Componente  | Mínimo (V4-Flash, GGUF Q4) | Recomendado (V4-Flash FP8)  | V4-Pro completo (BF16)           |
| ----------- | -------------------------- | --------------------------- | -------------------------------- |
| VRAM de GPU | 1× 80GB o 2× 48GB          | 1× H100 80GB o 1× A100 80GB | 8× H100 80GB o 4× H200 141GB     |
| RAM         | 64GB                       | 128 GB                      | 1TB+                             |
| Disco       | 200 GB NVMe                | 600 GB NVMe                 | 4 TB NVMe                        |
| CUDA        | 12.8+                      | 12.8+                       | 12.8+                            |
| Red         | —                          | —                           | NVLink / 400Gb IB para multinodo |

**Adecuación de hardware:** Para el 95% de los usuarios, **V4-Flash en FP8 en una tarjeta de clase 80GB** es el punto óptimo — contexto completo de 256K, sin pérdida por cuantización, [bare metal](https://clore.ai/bare-metal) en el mercado. Recurre a [H100](https://clore.ai/rent-h100.html) o [H200](https://clore.ai/rent-h200.html) configuraciones de paralelismo tensorial solo cuando realmente necesites el contexto 1M de V4-Pro o el margen adicional de razonamiento.

***

## Opción A — Ollama / GGUF (cuantizado, solo V4-Flash)

Unsloth publicó cuantizaciones GGUF para V4-Flash dentro de las 48 horas posteriores al lanzamiento. Q4\_K\_M es el punto óptimo — cabe en 1× 80GB o 2× 48GB y mantiene la calidad cerca de FP8.

```bash
# Obtener la compilación Unsloth Q4_K_M
docker exec ollama ollama pull hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M
docker exec ollama ollama run hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M

# O con llama.cpp directamente sobre un GGUF descargado
docker run --gpus all -it --rm -p 8080:8080 \
  -v $(pwd)/models:/models \
  ghcr.io/ggerganov/llama.cpp:server-cuda \
  -m /models/DeepSeek-V4-Flash-Q4_K_M.gguf \
  --n-gpu-layers 99 --ctx-size 65536 \
  --port 8080 --host 0.0.0.0
```

{% hint style="info" %}
Las cuantizaciones GGUF para V4-**Pro** existen pero no son prácticas — incluso Q2\_K ronda los 400 GB y el rendimiento de descarga es inutilizable para chat. Quédate con Flash para despliegues cuantizados.
{% endhint %}

***

## Opción B — vLLM (API de producción, recomendado)

vLLM 0.7.x añadió soporte desde el día 0 para ambos checkpoints de V4. Los kernels de atención híbrida necesitan `--trust-remote-code` y hardware Hopper o Blackwell para velocidad completa.

**V4-Flash en una sola H100 / A100 80GB:**

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model deepseek-ai/DeepSeek-V4-Flash
      --tensor-parallel-size 1
      --max-model-len 131072
      --dtype bfloat16
      --gpu-memory-utilization 0.92
      --enable-chunked-prefill
      --served-model-name deepseek-v4-flash
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

**V4-Pro en 8× H100 80GB:** cambia el comando por:

```yaml
    command: >
      --model deepseek-ai/DeepSeek-V4-Pro
      --tensor-parallel-size 8
      --max-model-len 262144
      --dtype bfloat16
      --gpu-memory-utilization 0.90
      --enable-chunked-prefill
      --enable-prefix-caching
      --served-model-name deepseek-v4-pro
      --trust-remote-code
```

```bash
# Probar la API
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{"role": "user", "content": "Escribe un servidor TCP echo asíncrono en Rust con apagado elegante."}],
    "max_tokens": 2048,
    "temperature": 0.6
  }'
```

{% hint style="info" %}
Empieza con `--max-model-len 131072` aunque al final quieras el contexto completo de 1M — los contextos largos aumentan drásticamente el tiempo de prefill y la memoria KV. Súbelo solo después de que la base esté estable.
{% endhint %}

***

## Opción C — SGLang (alternativa, a menudo más rápida en Hopper)

RadixAttention y el almacenamiento en caché de prefijos de SGLang encajan bien con la atención híbrida de V4 — para cargas de trabajo agénticas con prompts compartidos, espera tok/s notablemente mejor que en vLLM.

```bash
docker pull lmsysorg/sglang:latest

# V4-Flash en 1× H100/A100
python3 -m sglang.launch_server \\
  --model-path deepseek-ai/DeepSeek-V4-Flash \
  --tp-size 1 \\
  --context-length 131072 \
  --mem-fraction-static 0.90 \\
  --enable-torch-compile \
  --served-model-name deepseek-v4-flash \
  --trust-remote-code

# V4-Pro en 8× H100
python3 -m sglang.launch_server \\
  --model-path deepseek-ai/DeepSeek-V4-Pro \
  --tp-size 8 \\
  --context-length 262144 \\
  --mem-fraction-static 0.88 \
  --enable-torch-compile \
  --served-model-name deepseek-v4-pro \
  --trust-remote-code
```

de SGLang `--enable-torch-compile` normalmente añade otro 10–20% de rendimiento en Hopper después del calentamiento inicial.

***

## Recomendaciones de GPU para Clore.ai

| Configuración                                              | Modelo                              | VRAM        | Rendimiento esperado                       | Coste de Clore.ai                         |
| ---------------------------------------------------------- | ----------------------------------- | ----------- | ------------------------------------------ | ----------------------------------------- |
| 2× [RTX 4090](https://clore.ai/rent-4090.html) (GGUF Q4)   | V4-Flash                            | 48GB        | Uso aficionado, un solo flujo              | $0.14–0.42/h                              |
| 1× [A100 80GB](https://clore.ai/rent-a100-80gb.html) (FP8) | V4-Flash                            | 80 GB       | Producción sólida para un solo inquilino   | [bare metal](https://clore.ai/bare-metal) |
| 1× RTX 5090 32GB (GGUF Q4, descarga parcial)               | V4-Flash                            | 32 GB + RAM | Limitado, solo desarrollo                  | $0.25–0.77/h en pico                      |
| 4× [H100 80GB](https://clore.ai/rent-h100.html)            | V4-Flash FP8 (excesivo) o V4-Pro Q4 | 320 GB      | Flash multiinquilino, Pro de un solo flujo | \~$1.04/h                                 |
| 8× [H100 80GB](https://clore.ai/rent-h100.html)            | V4-Pro BF16                         | 640 GB      | Inferencia de frontera para producción     | \~$1.04/h                                 |
| 4× [H200 141GB](https://clore.ai/rent-h200.html)           | V4-Pro BF16 + contexto 1M           | 564 GB      | Contexto completo 1M, máximo rendimiento   | [bare metal](https://clore.ai/bare-metal) |

{% hint style="success" %}
**Mejor relación calidad-precio en Clore.ai:** Una A100 80GB ejecutando V4-Flash FP8. Obtienes 256K de contexto, un coste de inferencia activo de \~13B, sin pérdida por cuantización, y la factura es aproximadamente el precio de una suscripción a la API de Claude Sonnet — con pesos que se quedan en tu máquina.
{% endhint %}

***

## Casos de uso

* **Razonamiento de toda la base de código** — el contexto 1M de V4-Pro cabe en un monorrepo típico de 500K LOC más sus pruebas en un solo prompt
* **RAG de formato largo** — mete libros enteros, escritos judiciales o informes anuales en contexto y omite la canalización de fragmentación
* **Codificación agéntica** — V4-Flash iguala a V3 en SWE-Bench a una fracción del coste de inferencia; combínalo con SWE-agent o OpenHands
* **Síntesis de múltiples documentos** — los flujos de trabajo de investigación que antes necesitaban Gemini 2.5 Pro ahora se ejecutan en tu propio hardware
* **Reemplazo autogestionado de Cursor / Copilot** — V4-Flash en una sola A100 satura a un equipo de 5 desarrolladores
* **Base para ajuste fino** — la licencia MIT + la arquitectura MoE limpia lo convierten en un fuerte punto de partida para ajustes finos de dominio

***

## Pruebas comparativas

{% hint style="warning" %}
**Afirmado por el proveedor — verifica de forma independiente.** Los números de abajo provienen del anuncio de DeepSeek del 22 de abril de 2026 y de la tarjeta del modelo. Todavía se están publicando reproducciones independientes; tómalo como orientativo, no como evangelio.
{% endhint %}

| Benchmark                                | V4-Pro | V4-Flash | DeepSeek V3 | GLM-5.1 |
| ---------------------------------------- | ------ | -------- | ----------- | ------- |
| MMLU-Pro                                 | \~84%  | \~78%    | \~76%       | \~80%   |
| SWE-Bench Verified                       | \~82%  | \~74%    | \~70%       | \~79%   |
| HumanEval                                | \~96%  | \~92%    | \~91%       | \~94%   |
| MATH-500                                 | \~94%  | \~88%    | \~85%       | \~90%   |
| LiveCodeBench                            | \~76%  | \~68%    | \~62%       | \~72%   |
| Largo contexto (needle-in-a-haystack 1M) | \~98%  | n/d      | n/d         | n/d     |

Para una comparación de pesos abiertos de manzanas con manzanas, consulta la [guía de GLM-5.1](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-1.md) — V4-Pro y GLM-5.1 se disputan el liderazgo según el benchmark.

***

## Solución de problemas

| Problema                                     | Solución                                                                                                                                                                                                           |
| -------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ |
| `OutOfMemoryError` cargando V4-Pro en 8×H100 | BF16 necesita \~3.2TB — no puedes encajar Pro en un único nodo 8×H100. Usa 4× H200 141GB o multinodo.                                                                                                              |
| `backend de atención no compatible`          | V4 necesita vLLM ≥ 0.7.0 o SGLang ≥ 0.4.4. Ejecuta `pip install -U vllm` (o descarga la imagen Docker `:latest` ).                                                                                                 |
| Descarga lenta de HuggingFace                | Usa `huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download`. Pro es \~3.2TB; Flash es \~570GB.                                                                            |
| `--trust-remote-code` rechazado              | Los módulos de atención híbrida se publican como código personalizado en el repositorio — `--trust-remote-code` es necesario para ambos motores hasta que los kernels lleguen a Transformers aguas arriba.         |
| La salida GGUF Q4 es incomprensible          | Asegúrate de usar la compilación Unsloth (`unsloth/DeepSeek-V4-Flash-GGUF`), no una cuantización temprana de la comunidad. El router MoE necesita un manejo especial que las primeras cuantizaciones hicieron mal. |
| OOM de contexto 1M en V4-Pro                 | Baja a `--max-model-len 262144` y añade `--enable-prefix-caching`. El servicio real de 1M necesita H200 o B200.                                                                                                    |
| Prefill lento en contexto largo              | Esto es esperable — incluso con atención híbrida, un prefill de 500K+ tarda minutos, no segundos. Usa `--enable-chunked-prefill` y almacenamiento en caché de prefijos para amortizar.                             |

***

## Siguientes pasos

* **Predecesor:** [DeepSeek V3](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v3.md) — el modelo que V4-Flash reemplaza efectivamente
* **Hermano de razonamiento:** [DeepSeek-R1](/guides/guides_v2-es/modelos-de-lenguaje/deepseek-r1.md) — ajustado para cadena de pensamiento, sigue siendo útil para flujos de trabajo con mucha matemática
* **Alternativa de pesos abiertos:** [GLM-5.1](/guides/guides_v2-es/modelos-de-lenguaje/glm-5-1.md) — 744B MoE, líder en SWE-Bench Pro, rendimiento-precio comparable
* **Alternativa multimodal:** [Qwen3.5-Omni](/guides/guides_v2-es/modelos-de-lenguaje/qwen35-omni.md) — si necesitas visión/audio en el mismo modelo
* **Alquila el hardware:** [Marketplace de Clore.ai](https://clore.ai/marketplace) — H100/H200/A100/RTX 4090 desde $0.14–0.42/h

### Enlaces

* [DeepSeek-V4-Pro en HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro)
* [DeepSeek-V4-Flash en HuggingFace](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash)
* [Cuantizaciones GGUF de V4-Flash de Unsloth](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF)
* [GitHub de DeepSeek](https://github.com/deepseek-ai)
* [documentación de vLLM](https://docs.vllm.ai)
* [repositorio SGLang](https://github.com/sgl-project/sglang)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
