Modelo de razonamiento DeepSeek-R1
Ejecuta el modelo de razonamiento de código abierto DeepSeek-R1 en GPUs de Clore.ai
Todos los ejemplos se ejecutan en servidores GPU alquilados a través de la Marketplace de CLORE.AI. Las instancias RTX 4090 comienzan en $0.14–0.42/h.
Descripción general
DeepSeek-R1 es un modelo de razonamiento de peso abierto de 671 mil millones de parámetros, lanzado en enero de 2025 por DeepSeek bajo la Apache 2.0 licencia. Es el primer modelo abierto que iguala a OpenAI o1 en matemáticas, programación y pruebas científicas — mientras expone toda su cadena de pensamiento mediante <think> etiquetas.
El modelo completo usa Mezcla de expertos (MoE) con 37 mil millones de parámetros activos por token, lo que hace viable la inferencia a pesar del gran número total de parámetros. Para la mayoría de los practicantes, las variantes destiladas (1.5B → 70B) son más prácticas: heredan los patrones de razonamiento de R1 mediante destilación de conocimiento en las arquitecturas base Qwen-2.5 y Llama-3, y funcionan en GPUs de consumo.
Características clave
Cadena de pensamiento explícita — cada respuesta comienza con un
<think>bloque en el que el modelo razona, retrocede y se autocorrige antes de producir una respuesta finalEntrenado con aprendizaje por refuerzo — la capacidad de razonamiento surge de señales de recompensa de RL en lugar de datos de cadena de pensamiento escritos manualmente
Seis variantes destiladas — modelos de 1.5B, 7B, 8B, 14B, 32B y 70B parámetros destilados del modelo completo de 671B en arquitecturas Qwen y Llama
licencia Apache 2.0 — totalmente comercial, sin regalías, sin restricciones de uso
Amplio soporte de frameworks — Ollama, vLLM, llama.cpp, SGLang, Transformers y TGI funcionan de inmediato
AIME 2024 Pass@1: 79.8% — empata con OpenAI o1 en matemáticas de competición
Elo de Codeforces 2029 — supera los 1891 de o1 en programación competitiva
Variantes del modelo
DeepSeek-R1 (MoE completo)
671B (37B activos)
DeepSeek MoE
~1.3 TB
~350 GB
~340 GB
R1-Distill-Llama-70B
70B
Llama 3
140 GB
40 GB
42 GB
R1-Distill-Qwen-32B
32B
Qwen 2.5
64 GB
22 GB
20 GB
R1-Distill-Qwen-14B
14B
Qwen 2.5
28 GB
10 GB
9 GB
R1-Distill-Llama-8B
8B
Llama 3
16 GB
6 GB
5.5 GB
R1-Distill-Qwen-7B
7B
Qwen 2.5
14 GB
5 GB
4.5 GB
R1-Distill-Qwen-1.5B
1.5B
Qwen 2.5
3 GB
2 GB
1.2 GB
Elegir una variante
Experimentos rápidos, pruebas en el borde
R1-Distill-Qwen-1.5B
Cualquier GPU
Despliegue económico, inferencia rápida
R1-Distill-Qwen-7B
RTX 3090 ($0.07–0.21/hr)
Máxima calidad destilada
R1-Distill-Llama-70B
2× A100 de 80 GB
Investigación, razonamiento de fidelidad completa
DeepSeek-R1 671B
clúster de 8× H100
Repositorios de HuggingFace
R1 completo
Destilado Llama-70B
Destilado Qwen-32B
Destilado Qwen-14B
Destilado Llama-8B
Destilado Qwen-7B
Destilado Qwen-1.5B
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
VRAM de GPU
6 GB
24 GB
RAM del sistema
16 GB
32 GB
Disco
10 GB
30 GB
CUDA
12.8+
12.8+
Docker
24.0+
25.0+
Inicio rápido de Ollama
Ollama maneja automáticamente la cuantización, la descarga y la publicación — la ruta más rápida para tener un DeepSeek-R1 en ejecución.
Instalar y ejecutar
Ejemplo de sesión interactiva
Usa la API compatible con OpenAI
Cliente de Python (mediante OpenAI SDK)
Configuración de producción de vLLM
vLLM ofrece el mayor rendimiento para servir a varios usuarios con lotes continuos, PagedAttention y caché de prefijos.
Una sola GPU — 7B / 14B
Multi-GPU — 32B (recomendado)
Consejo: El checkpoint GPTQ o AWQ Q4 de 32B cabe en una sola RTX 4090 (24 GB):
Multi-GPU — 70B
Consulta el endpoint de vLLM
Transformers / Python (con <think> análisis de etiquetas)
Usa HuggingFace Transformers cuando necesites un control preciso sobre la generación o quieras integrar R1 en una canalización de Python.
Generación básica
Análisis <think> etiquetas
Streaming con <think> seguimiento de estado
Despliegue con Docker en Clore.ai
Docker de Ollama (lo más simple)
Imagen Docker: ollama/ollama Puertos: 22/tcp, 11434/http
Docker de vLLM (producción)
Imagen Docker: vllm/vllm-openai:latest Puertos: 22/tcp, 8000/http
Despliega en Clore.ai:
Abre clore.ai/marketplace
Filtrar por 2× GPU, 48 GB o más de VRAM en total (p. ej., 2× RTX 4090 o A100 de 80 GB)
Configura la imagen de Docker en
vllm/vllm-openai:latestMapea el puerto 8000 como HTTP
Pega el comando del archivo compose anterior en el comando de inicio
Conéctate mediante el endpoint HTTP una vez que pase la comprobación de salud
Consejos para despliegues en Clore.ai
Elegir la GPU adecuada
Mínima
RTX 3090 (24 GB)
$0.30 – 1.00
R1-Distill-Qwen-7B o 14B Q4
Estándar
RTX 4090 (24 GB)
$0.50 – 2.00
R1-Distill-Qwen-14B FP16 o 32B Q4
Producción
A100 80 GB
$3 – 8
R1-Distill-Qwen-32B FP16
Alta calidad
2× A100 de 80 GB
$6 – 16
R1-Distill-Llama-70B FP16
Ajuste de rendimiento
Temperatura 0.6 es el valor predeterminado recomendado para tareas de razonamiento — los propios artículos de DeepSeek usan este valor
Establece
max_tokensgenerosamente — los modelos de razonamiento producen<think>bloques largos; 4096+ para problemas no trivialesHabilita el almacenamiento en caché de prefijos (
--enable-prefix-caching(en vLLM) al usar un prompt del sistema compartidoLimita la concurrencia (
--max-num-seqs 16para cargas de trabajo de razonamiento — cada solicitud usa más cómputo que un chat estándarUsa cuantización Q4 para ajustar 32B en una sola GPU de 24 GB con una pérdida mínima de calidad (la destilación ya comprime el conocimiento de R1)
Consideraciones sobre la longitud del contexto
Los modelos de razonamiento consumen más contexto que los modelos de chat estándar debido al <think> bloque:
Aritmética simple
~100 tokens
~300 tokens
Generación de código
~500–1000 tokens
~2000 tokens
Matemáticas de competición (AIME)
~2000–4000 tokens
~5000 tokens
Análisis de investigación de varios pasos
~4000–8000 tokens
~10000 tokens
Solución de problemas
Fuera de memoria (OOM)
El modelo no produce <think> bloque
Algunos prompts del sistema suprimen el razonamiento. Evita instrucciones como "sé conciso" o "no expliques tu razonamiento". Usa un prompt del sistema mínimo o ninguno en absoluto:
Repetitivo o en bucle <think> salida
Reduce la temperatura para disminuir la aleatoriedad en la cadena de razonamiento:
Primer token lento (TTFT alto)
Esto es esperado — el modelo genera <think> tokens antes de la respuesta visible. Para aplicaciones sensibles a la latencia en las que no se necesita razonamiento, usa DeepSeek-V3 en su lugar.
La descarga se atasca en la instancia de Clore
Las descargas de HuggingFace pueden ser lentas en algunos proveedores. Precarga el modelo en un volumen persistente:
Lecturas adicionales
Documento de DeepSeek-R1 — Incentivar la capacidad de razonamiento en los LLM mediante aprendizaje por refuerzo
GitHub de DeepSeek-R1 — repositorio oficial con fichas de modelo
Guía de DeepSeek-V3 — modelo de propósito general sin razonamiento del mismo laboratorio
Guía de vLLM — configuración integral de serving en producción
Guía de Ollama — despliegue local sencillo para cualquier modelo
Guía de Open WebUI — interfaz de chat con renderizado nativo de
<think>etiquetasGuía de Qwen 2.5 — la arquitectura base utilizada por la mayoría de las destilaciones de R1
Última actualización
¿Te fue útil?