DeepSeek V4 (1.6T MoE, multimodal)
Despliega DeepSeek V4 en Clore.ai: el MoE frontier con licencia MIT, actualizado como Flash-0731 y Pro-0813
Qué cambió desde abril
Flash
DeepSeek-V4-Flash
DeepSeek-V4-Flash-0731 — 167 GB FP8, 43 capas, 256 expertos (6 activos), 1M de contexto, con decodificación especulativa DSpark adjunta
Pro
DeepSeek-V4-Pro
DeepSeek-V4-Pro-0813 — 893 GB FP8, 61 capas, 384 expertos (6 activos), 1M de contexto
Control del razonamiento
—
reasoning_effort: bajo, alto, máximo
Plantilla de chat
Jinja
No hay plantilla Jinja. El repositorio incluye un encoding/ carpeta con ayudantes de Python para construir prompts y analizar la salida
Flash-0731 supera la vista previa Pro de abril en los propios benchmarks de DeepSeek a pesar de tener una fracción de los parámetros activos: Terminal-Bench 2.1 82.7 (frente a 72.1), NL2Repo 54.2 (frente a 38.5), DeepSWE 54.4 (frente a 12.8), Toolathlon-Verified 70.3 (frente a 55.9). Esos son datos reportados por el proveedor, medidos con el propio entorno de DeepSeek en reasoning_effort: máximo.
Si implementaste la vista previa de abril, cambiar a -0731 es el cambio individual de mayor valor que puedes hacer ahora mismo en una implementación de DeepSeek.
Sirviendo Flash-0731 con decodificación especulativa
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
--data-parallel-size 4 --enable-expert-parallel \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'167 GB de pesos necesita un equipo, no una sola tarjeta. En el mercado de Clore.ai eso significa 6× RTX 5090 (186 GB) o 8× RTX 4090 (192 GB) — 72 servidores listados con ≥167 GB, 26 libres en la última captura. Las compilaciones GGUF cuantizadas lo reducen aún más. Pro-0813 con 893 GB es una bare metal implementación.
DeepSeek V4 es el primer modelo de frontera de pesos abiertos de 2026 en lanzarse como una lanzamiento de dos niveles. V4-Pro es el buque insignia — un Mixture-of-Experts de 1,6 billones de parámetros con aproximadamente 49B parámetros activos por token, un ventana de contexto de 1M tokens, y un diseño de atención híbrida que combina Compressed Sparse Attention con una nueva cabeza Heavily Compressed Attention para un prefill barato de largo contexto. V4-Flash es el hermano práctico — 284B total / 13B activos, la misma arquitectura, cabe en una sola GPU de 80GB cuando se cuantiza, y funciona cómodamente en una caja de 2×48GB con compilaciones Unsloth GGUF.
La arquitectura es la noticia principal. La atención híbrida de DeepSeek reduce drásticamente la memoria de la KV-cache en contexto largo, y el router MoE ha sido reentrenado para una selección de expertos más precisa — las primeras ejecuciones independientes informan que Pro alcanza puntuaciones de codificación del nivel de V3 con aproximadamente la mitad del cómputo de parámetros activos. Para los usuarios de Clore.ai esto importa porque V4-Flash es la primera vez que un modelo de frontera con menos de 15B parámetros activos se lanza con pesos completos, poniendo la inferencia abierta seria al alcance de una sola H100 o de una caja barata con varias RTX 4090.
Para la mayoría de los equipos, la implementación realista en Clore es V4-Flash en 1× A100 80GB o 2× RTX 4090 — ahí es donde vive la mejor relación precio-rendimiento. V4-Pro queda reservado para infraestructura seria: 8× H100, 4× H200 o 8× B200, idealmente con NVLink. Si has estado ejecutando DeepSeek V3 o DeepSeek-R1, la ruta de migración es sencilla — misma familia de modelos, misma plantilla de chat, reemplazo directo en vLLM.
Especificaciones clave
Parámetros totales
1.6T (MoE)
284B (MoE)
Parámetros activos
~49B por token
~13B por token
Ventana de contexto
1.000.000 tokens
256.000 tokens
Atención
Atención dispersa comprimida + Atención fuertemente comprimida
Atención dispersa comprimida + HCA
Licencia
MIT
MIT
Fecha de lanzamiento
22 de abril de 2026
22 de abril de 2026
Herramientas principales
vLLM, SGLang (día 0)
vLLM, SGLang, llama.cpp (GGUF de Unsloth)
¿Por qué DeepSeek V4?
Pesos de frontera verdaderamente abiertos — licencia MIT, sin restricciones de uso, uso comercial completo
1M de contexto en Pro, 256K en Flash — maneja bases de código completas, libros o transcripciones de horas en una sola pasada
Atención dispersa híbrida — la KV cache crece sublinealmente en contexto largo, el prefill es barato
Lanzamiento de dos niveles — Flash es el primer MoE con 13B activos lo bastante bueno para reemplazar V3 en la mayoría de los flujos de trabajo
Compatibilidad con vLLM y SGLang desde el día 0 — no hace falta esperar parches de la comunidad, solo
pip install -Uy listoEficiencia MoE — pagas el coste de inferencia de 13B/49B, no de 284B/1.6T
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
V4-Pro es un modelo de frontera. Los pesos BF16 completos son ~3.2TB y requieren H100/H200 multinodo o 8× B200 NVLink. No existe una ruta BF16 de un solo servidor. Si no tienes infraestructura multinodo, ejecuta V4-Flash — ofrece el 80% de la calidad al 5% del coste de hardware.
VRAM de GPU
1× 80GB o 2× 48GB
1× H100 80GB o 1× A100 80GB
8× H100 80GB o 4× H200 141GB
RAM
64GB
128 GB
1TB+
Disco
200 GB NVMe
600 GB NVMe
4 TB NVMe
CUDA
12.8+
12.8+
12.8+
Red
—
—
NVLink / 400Gb IB para multinodo
Adecuación de hardware: Para el 95% de los usuarios, V4-Flash en FP8 en una tarjeta de clase 80GB es el punto óptimo — contexto completo de 256K, sin pérdida por cuantización, bare metal en el mercado. Recurre a H100 o H200 configuraciones de paralelismo tensorial solo cuando realmente necesites el contexto 1M de V4-Pro o el margen adicional de razonamiento.
Opción A — Ollama / GGUF (cuantizado, solo V4-Flash)
Unsloth publicó cuantizaciones GGUF para V4-Flash dentro de las 48 horas posteriores al lanzamiento. Q4_K_M es el punto óptimo — cabe en 1× 80GB o 2× 48GB y mantiene la calidad cerca de FP8.
Opción B — vLLM (API de producción, recomendado)
vLLM 0.7.x añadió soporte desde el día 0 para ambos checkpoints de V4. Los kernels de atención híbrida necesitan --trust-remote-code y hardware Hopper o Blackwell para velocidad completa.
V4-Flash en una sola H100 / A100 80GB:
V4-Pro en 8× H100 80GB: cambia el comando por:
Opción C — SGLang (alternativa, a menudo más rápida en Hopper)
RadixAttention y el almacenamiento en caché de prefijos de SGLang encajan bien con la atención híbrida de V4 — para cargas de trabajo agénticas con prompts compartidos, espera tok/s notablemente mejor que en vLLM.
de SGLang --enable-torch-compile normalmente añade otro 10–20% de rendimiento en Hopper después del calentamiento inicial.
Recomendaciones de GPU para Clore.ai
1× RTX 5090 32GB (GGUF Q4, descarga parcial)
V4-Flash
32 GB + RAM
Limitado, solo desarrollo
$0.25–0.77/h en pico
4× H100 80GB
V4-Flash FP8 (excesivo) o V4-Pro Q4
320 GB
Flash multiinquilino, Pro de un solo flujo
~$1.04/h
Mejor relación calidad-precio en Clore.ai: Una A100 80GB ejecutando V4-Flash FP8. Obtienes 256K de contexto, un coste de inferencia activo de ~13B, sin pérdida por cuantización, y la factura es aproximadamente el precio de una suscripción a la API de Claude Sonnet — con pesos que se quedan en tu máquina.
Casos de uso
Razonamiento de toda la base de código — el contexto 1M de V4-Pro cabe en un monorrepo típico de 500K LOC más sus pruebas en un solo prompt
RAG de formato largo — mete libros enteros, escritos judiciales o informes anuales en contexto y omite la canalización de fragmentación
Codificación agéntica — V4-Flash iguala a V3 en SWE-Bench a una fracción del coste de inferencia; combínalo con SWE-agent o OpenHands
Síntesis de múltiples documentos — los flujos de trabajo de investigación que antes necesitaban Gemini 2.5 Pro ahora se ejecutan en tu propio hardware
Reemplazo autogestionado de Cursor / Copilot — V4-Flash en una sola A100 satura a un equipo de 5 desarrolladores
Base para ajuste fino — la licencia MIT + la arquitectura MoE limpia lo convierten en un fuerte punto de partida para ajustes finos de dominio
Pruebas comparativas
Afirmado por el proveedor — verifica de forma independiente. Los números de abajo provienen del anuncio de DeepSeek del 22 de abril de 2026 y de la tarjeta del modelo. Todavía se están publicando reproducciones independientes; tómalo como orientativo, no como evangelio.
MMLU-Pro
~84%
~78%
~76%
~80%
SWE-Bench Verified
~82%
~74%
~70%
~79%
HumanEval
~96%
~92%
~91%
~94%
MATH-500
~94%
~88%
~85%
~90%
LiveCodeBench
~76%
~68%
~62%
~72%
Largo contexto (needle-in-a-haystack 1M)
~98%
n/d
n/d
n/d
Para una comparación de pesos abiertos de manzanas con manzanas, consulta la guía de GLM-5.1 — V4-Pro y GLM-5.1 se disputan el liderazgo según el benchmark.
Solución de problemas
OutOfMemoryError cargando V4-Pro en 8×H100
BF16 necesita ~3.2TB — no puedes encajar Pro en un único nodo 8×H100. Usa 4× H200 141GB o multinodo.
backend de atención no compatible
V4 necesita vLLM ≥ 0.7.0 o SGLang ≥ 0.4.4. Ejecuta pip install -U vllm (o descarga la imagen Docker :latest ).
Descarga lenta de HuggingFace
Usa huggingface-cli download deepseek-ai/DeepSeek-V4-Flash --local-dir ./weights --resume-download. Pro es ~3.2TB; Flash es ~570GB.
--trust-remote-code rechazado
Los módulos de atención híbrida se publican como código personalizado en el repositorio — --trust-remote-code es necesario para ambos motores hasta que los kernels lleguen a Transformers aguas arriba.
La salida GGUF Q4 es incomprensible
Asegúrate de usar la compilación Unsloth (unsloth/DeepSeek-V4-Flash-GGUF), no una cuantización temprana de la comunidad. El router MoE necesita un manejo especial que las primeras cuantizaciones hicieron mal.
OOM de contexto 1M en V4-Pro
Baja a --max-model-len 262144 y añade --enable-prefix-caching. El servicio real de 1M necesita H200 o B200.
Prefill lento en contexto largo
Esto es esperable — incluso con atención híbrida, un prefill de 500K+ tarda minutos, no segundos. Usa --enable-chunked-prefill y almacenamiento en caché de prefijos para amortizar.
Siguientes pasos
Predecesor: DeepSeek V3 — el modelo que V4-Flash reemplaza efectivamente
Hermano de razonamiento: DeepSeek-R1 — ajustado para cadena de pensamiento, sigue siendo útil para flujos de trabajo con mucha matemática
Alternativa de pesos abiertos: GLM-5.1 — 744B MoE, líder en SWE-Bench Pro, rendimiento-precio comparable
Alternativa multimodal: Qwen3.5-Omni — si necesitas visión/audio en el mismo modelo
Alquila el hardware: Marketplace de Clore.ai — H100/H200/A100/RTX 4090 desde $0.14–0.42/h
Enlaces
Última actualización
¿Te fue útil?