vLLM
Inferencia de LLM de alto rendimiento con vLLM en las GPU de Clore.ai
Requisitos del servidor
Parámetro
Mínimo
Recomendado
¿Por qué vLLM?
Despliegue rápido en CLORE.AI
Verifica que esté funcionando
Acceso a tu servicio
Instalación
Usando Docker (recomendado)
Usando pip
Modelos compatibles
Modelo
Parámetros
VRAM requerida
RAM requerida
Opciones del servidor
Servidor básico
Servidor de producción
Con cuantización (menor VRAM)
Salidas estructuradas y llamada de herramientas (v0.7+)
Servicio Multi-LoRA (v0.7+)
Compatibilidad con DeepSeek-R1 (v0.7+)
DeepSeek-R1-Distill-Qwen-7B (GPU única)
DeepSeek-R1-Distill-Qwen-32B (GPU doble)
DeepSeek-R1-Distill-Llama-70B (GPU cuádruple)
Consulta de DeepSeek-R1
Uso de la API
Completions de chat (compatible con OpenAI)
Streaming
cURL
Completions de texto
Referencia completa de la API
Endpoints estándar
Endpoint
Método
Descripción
Endpoints adicionales
Endpoint
Método
Descripción
Tokenizar texto
Detokenizar
Obtener versión
Documentación de Swagger
Métricas de Prometheus
Puntos de referencia
Rendimiento (tokens/seg por usuario)
Modelo
RTX 3090
RTX 4090
A100 40 GB
A100 80 GB
Longitud de contexto vs VRAM
Modelo
ctx de 4K
ctx de 8K
ctx de 16K
ctx de 32K
Autenticación de Hugging Face
Requisitos de GPU
Modelo
VRAM mín.
RAM mín.
Recomendado
Estimación de costos
GPU
VRAM
Precio/día
Ideal para
Solución de problemas
HTTP 502 durante mucho tiempo
Falta de memoria
La descarga del modelo falla
vLLM frente a otros
Funcionalidad
vLLM
llama.cpp
Ollama
Próximos pasos
Última actualización
¿Te fue útil?