DeepSeek-V3
Ejecuta DeepSeek-V3 con razonamiento excepcional en GPUs de Clore.ai
Ejecute DeepSeek-V3, el LLM de código abierto de última generación con capacidades de razonamiento excepcionales en las GPU de CLORE.AI.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
¿Por qué DeepSeek-V3?
De última generación - Compite con GPT-4o y Claude 3.5 Sonnet
671B MoE - 671B de parámetros totales, 37B activos por token (inferencia eficiente)
Razonamiento mejorado - DeepSeek-V3-0324 es significativamente mejor en matemáticas y código
Eficiente - La arquitectura MoE reduce los costos de cómputo frente a los modelos densos
Código abierto - Pesos totalmente abiertos bajo licencia MIT
Contexto largo - Ventana de contexto de 128K tokens
¿Qué hay de nuevo en DeepSeek-V3-0324?
DeepSeek-V3-0324 (revisión de marzo de 2024) introduce mejoras significativas en áreas clave:
Generación de código
+8-12% en HumanEval en comparación con el V3 original
Mejor en bases de código de varios archivos y tareas complejas de refactorización
Mejor comprensión de frameworks modernos (FastAPI, Pydantic v2, LangChain v0.3)
Más fiable al generar código completo y ejecutable sin omisiones
Razonamiento matemático
+5% en MATH-500 benchmark
Mejor construcción de pruebas paso a paso
Mayor precisión numérica para problemas de varios pasos
Mayor capacidad para identificar y corregir errores a mitad de la solución
Razonamiento general
Deducción lógica e inferencia causal más sólidas
Mejor en tareas de planificación de varios pasos
Rendimiento más consistente en casos límite y prompts ambiguos
Mejor seguimiento de instrucciones en solicitudes complejas con múltiples restricciones
Despliegue rápido en CLORE.AI
Imagen de Docker:
Puertos:
Comando (se requieren varias GPU):
Accediendo a tu servicio
Después del despliegue, encuentra tu http_pub URL en Mis pedidos:
Ve a Mis pedidos página
Haz clic en tu pedido
Encuentra la
http_pubURL (p. ej.,abc123.clorecloud.net)
Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos a continuación.
Verifica que funciona
Importante: DeepSeek-V3 requiere 8x A100 80GB GPU y un tiempo de descarga considerable. El error HTTP 502 puede persistir durante 15 a 30 minutos mientras se descarga el modelo.
Variantes del modelo
Requisitos de hardware
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Precisión completa
DeepSeek-V3-0324
8x A100 80GB
8x H100 80GB
DeepSeek-V2.5
4x A100 80GB
4x H100 80GB
DeepSeek-V2-Lite
RTX 4090 24GB
A100 40GB
Cuantizado (AWQ/GPTQ)
DeepSeek-V3-0324
INT4
4x80GB
DeepSeek-V2.5
INT4
2x80GB
DeepSeek-V2-Lite
INT4
8GB
Instalación
Usando vLLM (recomendado)
Usando Transformers
Usando Ollama
Uso de la API
API compatible con OpenAI (vLLM)
Transmisión
cURL
DeepSeek-V2-Lite (una sola GPU)
Para usuarios con hardware limitado:
Generación de código
DeepSeek-V3-0324 es el mejor de su clase para código:
Tareas avanzadas de código en las que V3-0324 destaca:
Matemáticas y razonamiento
Configuración multi-GPU
8x GPU (modelo completo — V3-0324)
4x GPU (V2.5)
Rendimiento
Rendimiento (tokens/seg)
DeepSeek-V3-0324
8x H100
32K
~85
DeepSeek-V3-0324
8x A100 80GB
32K
~52
DeepSeek-V3-0324 INT4
4x A100 80GB
16K
~38
DeepSeek-V2.5
4x A100 80GB
16K
~70
DeepSeek-V2.5
2x A100 80GB
8K
~45
DeepSeek-V2-Lite
RTX 4090
8K
~40
DeepSeek-V2-Lite
RTX 3090
4K
~25
Tiempo hasta el primer token (TTFT)
DeepSeek-V3-0324
8x H100
~750ms
DeepSeek-V3-0324
8x A100
~1100ms
DeepSeek-V2.5
4x A100
~500ms
DeepSeek-V2-Lite
RTX 4090
~150 ms
Uso de memoria
DeepSeek-V3-0324
FP16
8x 80GB
DeepSeek-V3-0324
INT4
4x 80GB
DeepSeek-V2.5
FP16
4x 80GB
DeepSeek-V2.5
INT4
2x 80GB
DeepSeek-V2-Lite
FP16
20 GB
DeepSeek-V2-Lite
INT4
10GB
Pruebas comparativas
DeepSeek-V3-0324 frente a la competencia
MMLU
88.5%
87.1%
88.7%
88.3%
HumanEval
90.2%
82.6%
90.2%
92.0%
MATH-500
67.1%
61.6%
76.6%
71.1%
GSM8K
92.1%
89.3%
95.8%
96.4%
LiveCodeBench
72.4%
65.9%
71.3%
73.8%
Clasificación en Codeforces
1850
1720
1780
1790
Nota: la mejora en MATH-500 de V3 → V3-0324 es de +5,5 puntos porcentuales.
Docker Compose
Resumen de requisitos de GPU
DeepSeek-V3-0324 completo
8x A100 80GB
~$2.00
DeepSeek-V2.5
4x A100 80GB
~$1.00
Desarrollo/Pruebas
RTX 4090 (V2-Lite)
~$0.10
API de producción
8x H100 80GB
~$3.00
Estimación de costos
Tarifas típicas del mercado de CLORE.AI:
RTX 4090 24GB
~$0.10
~$2.30
A100 40GB
~$0.17
~$4.00
A100 80GB
~$0.25
~$6.00
4x A100 80GB
~$1.00
~$24.00
8x A100 80GB
~$2.00
~$48.00
Los precios varían según el proveedor. Consulta Marketplace de CLORE.AI las tarifas actuales.
Ahorra dinero:
Usa el Spot mercado para desarrollo — alrededor de un tercio de los precios spot de los servidores están por debajo del precio bajo demanda (mediana ~13% de descuento), el resto coincide con él
Paga con CLORE tokens
Usa DeepSeek-V2-Lite para pruebas antes de escalar
Solución de problemas
Sin memoria
Descarga del modelo lenta
Error de trust_remote_code
La configuración multi-GPU no funciona
DeepSeek frente a otros
Parámetros
671B (37B activos)
405B
176B (44B activos)
Contexto
128K
128K
64K
Código
Excelente
Excelente
Bueno
Matemáticas
Excelente
Bueno
Bueno
VRAM mínima
8x80GB
8x80GB
2x80GB
Licencia
MIT
Llama 3.1
Apache 2.0
Usa DeepSeek-V3 cuando:
Se necesita el mejor rendimiento de razonamiento
La generación de código es el uso principal
Las tareas de matemáticas/lógica son importantes
Tienes disponible una configuración multi-GPU
Quieres pesos totalmente de código abierto (licencia MIT)
Siguientes pasos
vLLM - Servidor de despliegue
DeepSeek-R1 - Variante especializada en razonamiento
DeepSeek Coder - Variante específica para código
Ollama - Despliegue más sencillo
Ajustar LLM - Entrenamiento personalizado
Última actualización
¿Te fue útil?