For the complete documentation index, see llms.txt. This page is also available as Markdown.

DeepSeek V4 (1.6T MoE, multimodal)

Despliega DeepSeek V4 en Clore.ai: el MoE frontier con licencia MIT, actualizado como Flash-0731 y Pro-0813

Estado (agosto de 2026): DeepSeek V4 se lanzó por primera vez el 22 de abril de 2026 bajo MIT, y ambos niveles se han actualizado desde entonces. Los checkpoints actuales son deepseek-ai/DeepSeek-V4-Flash-0731 (31 de julio de 2026, 167 GB FP8, 1M de contexto, módulo de decodificación especulativa adjunto) y deepseek-ai/DeepSeek-V4-Pro-0813 (13 de agosto de 2026, 893 GB FP8, 1M de contexto). Los repos de abril siguen disponibles como la generación de vista previa.

Qué cambió desde abril

Vista previa de abril
Actual

Flash

DeepSeek-V4-Flash

DeepSeek-V4-Flash-0731 — 167 GB FP8, 43 capas, 256 expertos (6 activos), 1M de contexto, con decodificación especulativa DSpark adjunta

Pro

DeepSeek-V4-Pro

DeepSeek-V4-Pro-0813 — 893 GB FP8, 61 capas, 384 expertos (6 activos), 1M de contexto

Control del razonamiento

reasoning_effort: bajo, alto, máximo

Plantilla de chat

Jinja

No hay plantilla Jinja. El repositorio incluye un encoding/ carpeta con ayudantes de Python para construir prompts y analizar la salida

Flash-0731 supera la vista previa Pro de abril en los propios benchmarks de DeepSeek a pesar de tener una fracción de los parámetros activos: Terminal-Bench 2.1 82.7 (frente a 72.1), NL2Repo 54.2 (frente a 38.5), DeepSWE 54.4 (frente a 12.8), Toolathlon-Verified 70.3 (frente a 55.9). Esos son datos reportados por el proveedor, medidos con el propio entorno de DeepSeek en reasoning_effort: máximo.

Si implementaste la vista previa de abril, cambiar a -0731 es el cambio individual de mayor valor que puedes hacer ahora mismo en una implementación de DeepSeek.

Sirviendo Flash-0731 con decodificación especulativa

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

DeepSeek V4 es el primer modelo de frontera de pesos abiertos de 2026 en lanzarse como una lanzamiento de dos niveles. V4-Pro es el buque insignia — un Mixture-of-Experts de 1,6 billones de parámetros con aproximadamente 49B parámetros activos por token, un ventana de contexto de 1M tokens, y un diseño de atención híbrida que combina Compressed Sparse Attention con una nueva cabeza Heavily Compressed Attention para un prefill barato de largo contexto. V4-Flash es el hermano práctico — 284B total / 13B activos, la misma arquitectura, cabe en una sola GPU de 80GB cuando se cuantiza, y funciona cómodamente en una caja de 2×48GB con compilaciones Unsloth GGUF.

La arquitectura es la noticia principal. La atención híbrida de DeepSeek reduce drásticamente la memoria de la KV-cache en contexto largo, y el router MoE ha sido reentrenado para una selección de expertos más precisa — las primeras ejecuciones independientes informan que Pro alcanza puntuaciones de codificación del nivel de V3 con aproximadamente la mitad del cómputo de parámetros activos. Para los usuarios de Clore.ai esto importa porque V4-Flash es la primera vez que un modelo de frontera con menos de 15B parámetros activos se lanza con pesos completos, poniendo la inferencia abierta seria al alcance de una sola H100 o de una caja barata con varias RTX 4090.

Para la mayoría de los equipos, la implementación realista en Clore es V4-Flash en 1× A100 80GB o 2× RTX 4090 — ahí es donde vive la mejor relación precio-rendimiento. V4-Pro queda reservado para infraestructura seria: 8× H100, 4× H200 o 8× B200, idealmente con NVLink. Si has estado ejecutando DeepSeek V3 o DeepSeek-R1, la ruta de migración es sencilla — misma familia de modelos, misma plantilla de chat, reemplazo directo en vLLM.

Especificaciones clave

Propiedad
DeepSeek V4-Pro
DeepSeek V4-Flash

Parámetros totales

1.6T (MoE)

284B (MoE)

Parámetros activos

~49B por token

~13B por token

Ventana de contexto

1.000.000 tokens

256.000 tokens

Atención

Atención dispersa comprimida + Atención fuertemente comprimida

Atención dispersa comprimida + HCA

Licencia

MIT

MIT

Fecha de lanzamiento

22 de abril de 2026

22 de abril de 2026

Herramientas principales

vLLM, SGLang (día 0)

vLLM, SGLang, llama.cpp (GGUF de Unsloth)

¿Por qué DeepSeek V4?

  • Pesos de frontera verdaderamente abiertos — licencia MIT, sin restricciones de uso, uso comercial completo

  • 1M de contexto en Pro, 256K en Flash — maneja bases de código completas, libros o transcripciones de horas en una sola pasada

  • Atención dispersa híbrida — la KV cache crece sublinealmente en contexto largo, el prefill es barato

  • Lanzamiento de dos niveles — Flash es el primer MoE con 13B activos lo bastante bueno para reemplazar V3 en la mayoría de los flujos de trabajo

  • Compatibilidad con vLLM y SGLang desde el día 0 — no hace falta esperar parches de la comunidad, solo pip install -U y listo

  • Eficiencia MoE — pagas el coste de inferencia de 13B/49B, no de 284B/1.6T


Requisitos

Componente
Mínimo (V4-Flash, GGUF Q4)
Recomendado (V4-Flash FP8)
V4-Pro completo (BF16)

VRAM de GPU

1× 80GB o 2× 48GB

1× H100 80GB o 1× A100 80GB

8× H100 80GB o 4× H200 141GB

RAM

64GB

128 GB

1TB+

Disco

200 GB NVMe

600 GB NVMe

4 TB NVMe

CUDA

12.8+

12.8+

12.8+

Red

NVLink / 400Gb IB para multinodo

Adecuación de hardware: Para el 95% de los usuarios, V4-Flash en FP8 en una tarjeta de clase 80GB es el punto óptimo — contexto completo de 256K, sin pérdida por cuantización, bare metal en el mercado. Recurre a H100 o H200 configuraciones de paralelismo tensorial solo cuando realmente necesites el contexto 1M de V4-Pro o el margen adicional de razonamiento.


Opción A — Ollama / GGUF (cuantizado, solo V4-Flash)

Unsloth publicó cuantizaciones GGUF para V4-Flash dentro de las 48 horas posteriores al lanzamiento. Q4_K_M es el punto óptimo — cabe en 1× 80GB o 2× 48GB y mantiene la calidad cerca de FP8.

Las cuantizaciones GGUF para V4-Pro existen pero no son prácticas — incluso Q2_K ronda los 400 GB y el rendimiento de descarga es inutilizable para chat. Quédate con Flash para despliegues cuantizados.


Opción B — vLLM (API de producción, recomendado)

vLLM 0.7.x añadió soporte desde el día 0 para ambos checkpoints de V4. Los kernels de atención híbrida necesitan --trust-remote-code y hardware Hopper o Blackwell para velocidad completa.

V4-Flash en una sola H100 / A100 80GB:

V4-Pro en 8× H100 80GB: cambia el comando por:

Empieza con --max-model-len 131072 aunque al final quieras el contexto completo de 1M — los contextos largos aumentan drásticamente el tiempo de prefill y la memoria KV. Súbelo solo después de que la base esté estable.


Opción C — SGLang (alternativa, a menudo más rápida en Hopper)

RadixAttention y el almacenamiento en caché de prefijos de SGLang encajan bien con la atención híbrida de V4 — para cargas de trabajo agénticas con prompts compartidos, espera tok/s notablemente mejor que en vLLM.

de SGLang --enable-torch-compile normalmente añade otro 10–20% de rendimiento en Hopper después del calentamiento inicial.


Recomendaciones de GPU para Clore.ai

Configuración
Modelo
VRAM
Rendimiento esperado
Coste de Clore.ai

RTX 4090 (GGUF Q4)

V4-Flash

48GB

Uso aficionado, un solo flujo

$0.14–0.42/h

A100 80GB (FP8)

V4-Flash

80 GB

Producción sólida para un solo inquilino

1× RTX 5090 32GB (GGUF Q4, descarga parcial)

V4-Flash

32 GB + RAM

Limitado, solo desarrollo

$0.25–0.77/h en pico

V4-Flash FP8 (excesivo) o V4-Pro Q4

320 GB

Flash multiinquilino, Pro de un solo flujo

~$1.04/h

V4-Pro BF16

640 GB

Inferencia de frontera para producción

~$1.04/h

V4-Pro BF16 + contexto 1M

564 GB

Contexto completo 1M, máximo rendimiento


Casos de uso

  • Razonamiento de toda la base de código — el contexto 1M de V4-Pro cabe en un monorrepo típico de 500K LOC más sus pruebas en un solo prompt

  • RAG de formato largo — mete libros enteros, escritos judiciales o informes anuales en contexto y omite la canalización de fragmentación

  • Codificación agéntica — V4-Flash iguala a V3 en SWE-Bench a una fracción del coste de inferencia; combínalo con SWE-agent o OpenHands

  • Síntesis de múltiples documentos — los flujos de trabajo de investigación que antes necesitaban Gemini 2.5 Pro ahora se ejecutan en tu propio hardware

  • Reemplazo autogestionado de Cursor / Copilot — V4-Flash en una sola A100 satura a un equipo de 5 desarrolladores

  • Base para ajuste fino — la licencia MIT + la arquitectura MoE limpia lo convierten en un fuerte punto de partida para ajustes finos de dominio


Pruebas comparativas

Benchmark
V4-Pro
V4-Flash
DeepSeek V3
GLM-5.1

MMLU-Pro

~84%

~78%

~76%

~80%

SWE-Bench Verified

~82%

~74%

~70%

~79%

HumanEval

~96%

~92%

~91%

~94%

MATH-500

~94%

~88%

~85%

~90%

LiveCodeBench

~76%

~68%

~62%

~72%

Largo contexto (needle-in-a-haystack 1M)

~98%

n/d

n/d

n/d

Para una comparación de pesos abiertos de manzanas con manzanas, consulta la guía de GLM-5.1 — V4-Pro y GLM-5.1 se disputan el liderazgo según el benchmark.


Solución de problemas

Problema
Solución

OutOfMemoryError cargando V4-Pro en 8×H100

BF16 necesita ~3.2TB — no puedes encajar Pro en un único nodo 8×H100. Usa 4× H200 141GB o multinodo.

backend de atención no compatible

V4 necesita vLLM ≥ 0.7.0 o SGLang ≥ 0.4.4. Ejecuta pip install -U vllm (o descarga la imagen Docker :latest ).

Descarga lenta de HuggingFace

Usa huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download. Pro es ~3.2TB; Flash es ~570GB.

--trust-remote-code rechazado

Los módulos de atención híbrida se publican como código personalizado en el repositorio — --trust-remote-code es necesario para ambos motores hasta que los kernels lleguen a Transformers aguas arriba.

La salida GGUF Q4 es incomprensible

Asegúrate de usar la compilación Unsloth (unsloth/DeepSeek-V4-Flash-GGUF), no una cuantización temprana de la comunidad. El router MoE necesita un manejo especial que las primeras cuantizaciones hicieron mal.

OOM de contexto 1M en V4-Pro

Baja a --max-model-len 262144 y añade --enable-prefix-caching. El servicio real de 1M necesita H200 o B200.

Prefill lento en contexto largo

Esto es esperable — incluso con atención híbrida, un prefill de 500K+ tarda minutos, no segundos. Usa --enable-chunked-prefill y almacenamiento en caché de prefijos para amortizar.


Siguientes pasos

  • Predecesor: DeepSeek V3 — el modelo que V4-Flash reemplaza efectivamente

  • Hermano de razonamiento: DeepSeek-R1 — ajustado para cadena de pensamiento, sigue siendo útil para flujos de trabajo con mucha matemática

  • Alternativa de pesos abiertos: GLM-5.1 — 744B MoE, líder en SWE-Bench Pro, rendimiento-precio comparable

  • Alternativa multimodal: Qwen3.5-Omni — si necesitas visión/audio en el mismo modelo

  • Alquila el hardware: Marketplace de Clore.ai — H100/H200/A100/RTX 4090 desde $0.14–0.42/h

Enlaces

Última actualización

¿Te fue útil?