For the complete documentation index, see llms.txt. This page is also available as Markdown.

vLLM

Inferencia de LLM de alto rendimiento con vLLM en las GPU de Clore.ai

Servidor de inferencia LLM de alto rendimiento para cargas de trabajo de producción en GPUs de CLORE.AI.

Versión actual: v0.7.x — Esta guía cubre vLLM v0.7.3+. Las nuevas funciones incluyen compatibilidad con DeepSeek-R1, salidas estructuradas con selección automática de herramientas, servicio multi-LoRA y una mejor eficiencia de memoria.

Requisitos del servidor

Parámetro
Mínimo
Recomendado

RAM

16 GB

32 GB+

VRAM

16 GB (7B)

24 GB+

Red

500 Mbps

1 Gbps+

Tiempo de inicio

5-15 minutos

-

¿Necesitas una GPU compatible? Una RTX 4090 (24 GB) maneja cómodamente 7B–13B; para modelos de 70B+ una H100 (80 GB) es la opción más segura.

¿Por qué vLLM?

  • Mayor rendimiento - PagedAttention para un rendimiento 24x mayor

  • Listo para producción - API compatible con OpenAI desde el principio

  • Batching continuo - Servicio eficiente para múltiples usuarios

  • Streaming - Generación de tokens en tiempo real

  • Multi-GPU - Paralelismo de tensores para modelos grandes

  • Multi-LoRA - Sirve varios adaptadores ajustados simultáneamente (v0.7+)

  • Salidas estructuradas - Aplicación de esquema JSON y llamada de herramientas (v0.7+)

Despliegue rápido en CLORE.AI

Imagen de Docker:

Puertos:

Comando:

Verifica que esté funcionando

Después del despliegue, encuentra tu http_pub URL en Mis pedidos:

Acceso a tu servicio

Cuando se despliega en CLORE.AI, accede a vLLM a través de la http_pub URL:

Todos localhost:8000 los ejemplos a continuación funcionan cuando se conecta por SSH. Para acceso externo, reemplaza con tu https://your-http-pub.clorecloud.net/ URL.

Instalación

Usando Docker (recomendado)

Usando pip

Modelos compatibles

Modelo
Parámetros
VRAM requerida
RAM requerida

Mistral 7B

7B

14 GB

16 GB+

Llama 3.1 8B

8B

16 GB

16 GB+

Llama 3.1 70B

70B

140 GB (o 2x80 GB)

64 GB+

Mixtral 8x7B

47B

90 GB

32 GB+

Qwen2.5 7B

7B

14 GB

16 GB+

Qwen2.5 72B

72B

145 GB

64 GB+

DeepSeek-V3

236B MoE

Multi-GPU

128 GB+

DeepSeek-R1-Distill-Qwen-7B

7B

14 GB

16 GB+

DeepSeek-R1-Distill-Qwen-32B

32B

64 GB

32 GB+

DeepSeek-R1-Distill-Llama-70B

70B

140 GB

64 GB+

Phi-4

14B

28 GB

32 GB+

Gemma 2 9B

9B

18 GB

16 GB+

CodeLlama 34B

34B

68 GB

32 GB+

Opciones del servidor

Servidor básico

Servidor de producción

Con cuantización (menor VRAM)

Salidas estructuradas y llamada de herramientas (v0.7+)

Habilita la elección automática de herramientas y salidas JSON estructuradas:

Usar en Python:

Salida JSON estructurada mediante el formato de respuesta:

Servicio Multi-LoRA (v0.7+)

Sirve un modelo base con múltiples adaptadores LoRA simultáneamente:

Consulta un adaptador LoRA específico por nombre de modelo:

Compatibilidad con DeepSeek-R1 (v0.7+)

vLLM v0.7+ tiene compatibilidad nativa con los modelos distill de DeepSeek-R1. Estos modelos de razonamiento producen <think> etiquetas que muestran su proceso de razonamiento.

DeepSeek-R1-Distill-Qwen-7B (GPU única)

DeepSeek-R1-Distill-Qwen-32B (GPU doble)

DeepSeek-R1-Distill-Llama-70B (GPU cuádruple)

Consulta de DeepSeek-R1

Analizando etiquetas think:

Uso de la API

Completions de chat (compatible con OpenAI)

Streaming

cURL

Completions de texto

Referencia completa de la API

vLLM proporciona endpoints compatibles con OpenAI, además de endpoints de utilidad adicionales.

Endpoints estándar

Endpoint
Método
Descripción

/v1/models

GET

Lista los modelos disponibles

/v1/chat/completions

POST

Finalización de chat

/v1/completions

POST

Finalización de texto

/health

GET

Verificación de estado (puede devolver vacío)

Endpoints adicionales

Endpoint
Método
Descripción

/tokenize

POST

Tokenizar texto

/detokenize

POST

Convertir tokens a texto

/version

GET

Obtener la versión de vLLM

/docs

GET

Documentación de Swagger UI

/metrics

GET

Métricas de Prometheus

Tokenizar texto

Útil para contar tokens antes de enviar solicitudes:

Respuesta:

Detokenizar

Convierte IDs de tokens de nuevo a texto:

Respuesta:

Obtener versión

Respuesta:

Documentación de Swagger

Ábrelo en el navegador para una documentación interactiva de la API:

Métricas de Prometheus

Para monitoreo:

Modelos de razonamiento: DeepSeek-R1 y modelos similares incluyen <think> etiquetas en las respuestas que muestran el proceso de razonamiento del modelo antes de la respuesta final.

Puntos de referencia

Rendimiento (tokens/seg por usuario)

Modelo
RTX 3090
RTX 4090
A100 40 GB
A100 80 GB

Mistral 7B

100

170

210

230

Llama 3.1 8B

95

150

200

220

Llama 3.1 8B (AWQ)

130

190

260

280

Mixtral 8x7B

-

45

70

85

Llama 3.1 70B

-

-

25 (2x)

45 (2x)

DeepSeek-R1 7B

90

145

190

210

DeepSeek-R1 32B

-

-

40

70 (2x)

Puntos de referencia actualizados en enero de 2026.

Longitud de contexto vs VRAM

Modelo
ctx de 4K
ctx de 8K
ctx de 16K
ctx de 32K

8B FP16

18 GB

22 GB

30 GB

46 GB

8B AWQ

8 GB

10 GB

14 GB

22 GB

70B FP16

145 GB

160 GB

190 GB

250 GB

70B AWQ

42 GB

50 GB

66 GB

98 GB

Autenticación de Hugging Face

Para modelos restringidos (Llama, etc.):

O establecerlo como variable de entorno:

Requisitos de GPU

Modelo
VRAM mín.
RAM mín.
Recomendado

7-8B

16 GB

16 GB

24 GB de VRAM, 32 GB de RAM

13B

26 GB

32 GB

40 GB de VRAM

34B

70 GB

32 GB

80 GB de VRAM

70B

140 GB

64 GB

2x80 GB

Estimación de costos

Tarifas típicas del marketplace de CLORE.AI:

GPU
VRAM
Precio/día
Ideal para

RTX 3090

24 GB

$0.30–1.00

modelos de 7-8B

RTX 4090

24 GB

$0.50–2.00

7-13B, rápido

A100

40 GB

$1.50–3.00

modelos de 13-34B

A100

80 GB

$2.00–4.00

modelos de 34-70B

Precios en USD/día. Las tarifas varían según el proveedor — consulta CLORE.AI Marketplace para ver las tarifas actuales.

Solución de problemas

HTTP 502 durante mucho tiempo

  1. Comprueba la RAM: El servidor debe tener 16 GB+ de RAM

  2. Comprueba la VRAM: Debe caber el modelo

  3. Descarga del modelo: La primera ejecución descarga desde HuggingFace (5-15 min)

  4. Token HF: Los modelos restringidos requieren autenticación

Falta de memoria

La descarga del modelo falla

vLLM frente a otros

Funcionalidad
vLLM
llama.cpp
Ollama

Rendimiento

Mejor

Bueno

Bueno

Uso de VRAM

Alto

Bajo

Medio

Facilidad de uso

Medio

Medio

Fácil

Tiempo de inicio

5-15 min

1-2 min

30 seg

Multi-GPU

Nativo

Limitado

Limitado

Invocación de herramientas

Sí (v0.7+)

Limitado

Limitado

Multi-LoRA

Sí (v0.7+)

No

No

Usa vLLM cuando:

  • El alto rendimiento es la prioridad

  • Sirves a varios usuarios

  • Tienes suficiente VRAM y RAM

  • Despliegue en producción

  • Necesitas invocación de herramientas / salidas estructuradas

Usa Ollama cuando:

  • Se necesita una configuración rápida

  • Un solo usuario

  • Hay menos recursos disponibles

Próximos pasos

Última actualización

¿Te fue útil?