For the complete documentation index, see llms.txt. This page is also available as Markdown.

Modelo de razonamiento DeepSeek-R1

Ejecuta el modelo de razonamiento de código abierto DeepSeek-R1 en GPUs de Clore.ai

Descripción general

DeepSeek-R1 es un modelo de razonamiento de peso abierto de 671 mil millones de parámetros, lanzado en enero de 2025 por DeepSeek bajo la Apache 2.0 licencia. Es el primer modelo abierto que iguala a OpenAI o1 en matemáticas, programación y pruebas científicas — mientras expone toda su cadena de pensamiento mediante <think> etiquetas.

El modelo completo usa Mezcla de expertos (MoE) con 37 mil millones de parámetros activos por token, lo que hace viable la inferencia a pesar del gran número total de parámetros. Para la mayoría de los practicantes, las variantes destiladas (1.5B → 70B) son más prácticas: heredan los patrones de razonamiento de R1 mediante destilación de conocimiento en las arquitecturas base Qwen-2.5 y Llama-3, y funcionan en GPUs de consumo.

Características clave

  • Cadena de pensamiento explícita — cada respuesta comienza con un <think> bloque en el que el modelo razona, retrocede y se autocorrige antes de producir una respuesta final

  • Entrenado con aprendizaje por refuerzo — la capacidad de razonamiento surge de señales de recompensa de RL en lugar de datos de cadena de pensamiento escritos manualmente

  • Seis variantes destiladas — modelos de 1.5B, 7B, 8B, 14B, 32B y 70B parámetros destilados del modelo completo de 671B en arquitecturas Qwen y Llama

  • licencia Apache 2.0 — totalmente comercial, sin regalías, sin restricciones de uso

  • Amplio soporte de frameworks — Ollama, vLLM, llama.cpp, SGLang, Transformers y TGI funcionan de inmediato

  • AIME 2024 Pass@1: 79.8% — empata con OpenAI o1 en matemáticas de competición

  • Elo de Codeforces 2029 — supera los 1891 de o1 en programación competitiva

Variantes del modelo

Variante
Parámetros
Arquitectura
VRAM FP16
VRAM Q4
Disco Q4

DeepSeek-R1 (MoE completo)

671B (37B activos)

DeepSeek MoE

~1.3 TB

~350 GB

~340 GB

R1-Distill-Llama-70B

70B

Llama 3

140 GB

40 GB

42 GB

R1-Distill-Qwen-32B

32B

Qwen 2.5

64 GB

22 GB

20 GB

R1-Distill-Qwen-14B

14B

Qwen 2.5

28 GB

10 GB

9 GB

R1-Distill-Llama-8B

8B

Llama 3

16 GB

6 GB

5.5 GB

R1-Distill-Qwen-7B

7B

Qwen 2.5

14 GB

5 GB

4.5 GB

R1-Distill-Qwen-1.5B

1.5B

Qwen 2.5

3 GB

2 GB

1.2 GB

Elegir una variante

Caso de uso
Variante recomendada
GPU en Clore

Experimentos rápidos, pruebas en el borde

R1-Distill-Qwen-1.5B

Cualquier GPU

Despliegue económico, inferencia rápida

R1-Distill-Qwen-7B

RTX 3090 ($0.07–0.21/hr)

Punto ideal de producción con una sola GPU

R1-Distill-Qwen-14B Q4

RTX 4090 ($0.14–0.42/hr)

Mejor calidad por dólar (recomendado)

R1-Distill-Qwen-32B Q4

RTX 4090 24 GB o A100 de 40 GB

Máxima calidad destilada

R1-Distill-Llama-70B

2× A100 de 80 GB

Investigación, razonamiento de fidelidad completa

DeepSeek-R1 671B

clúster de 8× H100

Repositorios de HuggingFace

Requisitos

Componente
Mínimo (7B Q4)
Recomendado (32B Q4)

VRAM de GPU

6 GB

24 GB

RAM del sistema

16 GB

32 GB

Disco

10 GB

30 GB

CUDA

12.8+

12.8+

Docker

24.0+

25.0+

Inicio rápido de Ollama

Ollama maneja automáticamente la cuantización, la descarga y la publicación — la ruta más rápida para tener un DeepSeek-R1 en ejecución.

Instalar y ejecutar

Ejemplo de sesión interactiva

Usa la API compatible con OpenAI

Cliente de Python (mediante OpenAI SDK)

Configuración de producción de vLLM

vLLM ofrece el mayor rendimiento para servir a varios usuarios con lotes continuos, PagedAttention y caché de prefijos.

Una sola GPU — 7B / 14B

Multi-GPU — 32B (recomendado)

Consejo: El checkpoint GPTQ o AWQ Q4 de 32B cabe en una sola RTX 4090 (24 GB):

Multi-GPU — 70B

Consulta el endpoint de vLLM

Transformers / Python (con <think> análisis de etiquetas)

Usa HuggingFace Transformers cuando necesites un control preciso sobre la generación o quieras integrar R1 en una canalización de Python.

Generación básica

Análisis <think> etiquetas

Streaming con <think> seguimiento de estado

Despliegue con Docker en Clore.ai

Docker de Ollama (lo más simple)

Imagen Docker: ollama/ollama Puertos: 22/tcp, 11434/http

Docker de vLLM (producción)

Imagen Docker: vllm/vllm-openai:latest Puertos: 22/tcp, 8000/http

Despliega en Clore.ai:

  1. Filtrar por 2× GPU, 48 GB o más de VRAM en total (p. ej., 2× RTX 4090 o A100 de 80 GB)

  2. Configura la imagen de Docker en vllm/vllm-openai:latest

  3. Mapea el puerto 8000 como HTTP

  4. Pega el comando del archivo compose anterior en el comando de inicio

  5. Conéctate mediante el endpoint HTTP una vez que pase la comprobación de salud

Consejos para despliegues en Clore.ai

Elegir la GPU adecuada

Económico
GPU
Costo diario
Mejor variante

Mínima

RTX 3090 (24 GB)

$0.30 – 1.00

R1-Distill-Qwen-7B o 14B Q4

Estándar

RTX 4090 (24 GB)

$0.50 – 2.00

R1-Distill-Qwen-14B FP16 o 32B Q4

Producción

A100 80 GB

$3 – 8

R1-Distill-Qwen-32B FP16

Alta calidad

2× A100 de 80 GB

$6 – 16

R1-Distill-Llama-70B FP16

Ajuste de rendimiento

  • Temperatura 0.6 es el valor predeterminado recomendado para tareas de razonamiento — los propios artículos de DeepSeek usan este valor

  • Establece max_tokens generosamente — los modelos de razonamiento producen <think> bloques largos; 4096+ para problemas no triviales

  • Habilita el almacenamiento en caché de prefijos (--enable-prefix-caching (en vLLM) al usar un prompt del sistema compartido

  • Limita la concurrencia (--max-num-seqs 16para cargas de trabajo de razonamiento — cada solicitud usa más cómputo que un chat estándar

  • Usa cuantización Q4 para ajustar 32B en una sola GPU de 24 GB con una pérdida mínima de calidad (la destilación ya comprime el conocimiento de R1)

Consideraciones sobre la longitud del contexto

Los modelos de razonamiento consumen más contexto que los modelos de chat estándar debido al <think> bloque:

Complejidad de la tarea
Longitud típica del razonamiento
Contexto total necesario

Aritmética simple

~100 tokens

~300 tokens

Generación de código

~500–1000 tokens

~2000 tokens

Matemáticas de competición (AIME)

~2000–4000 tokens

~5000 tokens

Análisis de investigación de varios pasos

~4000–8000 tokens

~10000 tokens

Solución de problemas

Fuera de memoria (OOM)

El modelo no produce <think> bloque

Algunos prompts del sistema suprimen el razonamiento. Evita instrucciones como "sé conciso" o "no expliques tu razonamiento". Usa un prompt del sistema mínimo o ninguno en absoluto:

Repetitivo o en bucle <think> salida

Reduce la temperatura para disminuir la aleatoriedad en la cadena de razonamiento:

Primer token lento (TTFT alto)

Esto es esperado — el modelo genera <think> tokens antes de la respuesta visible. Para aplicaciones sensibles a la latencia en las que no se necesita razonamiento, usa DeepSeek-V3 en su lugar.

La descarga se atasca en la instancia de Clore

Las descargas de HuggingFace pueden ser lentas en algunos proveedores. Precarga el modelo en un volumen persistente:

Lecturas adicionales

Última actualización

¿Te fue útil?