Pasarela de IA LiteLLM
Despliega LiteLLM como proxy de pasarela de IA para más de 100 LLMs en GPUs de Clore.ai
LiteLLM es una puerta de enlace de IA de código abierto que proporciona una API unificada compatible con OpenAI para más de 100 proveedores de modelos de lenguaje, incluidos OpenAI, Anthropic, Azure, Bedrock, HuggingFace y modelos alojados localmente. Despliega esto en CLORE.AI para enrutar, equilibrar la carga y gestionar todas tus llamadas a la API de LLM a través de un único endpoint con seguimiento de costes integrado, limitación de tasa y lógica de fallback.
El verdadero poder de LiteLLM se ve a escala: los equipos que ejecutan pilas mixtas local+nube pueden intercambiar modelos al vuelo sin tocar el código de la aplicación. Reemplaza gpt-4o con mistral-7b-local en la configuración, reinicia — hecho.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Requisitos del servidor
RAM
4 GB
8 GB+
VRAM
N/A (solo proxy)
N/A
Disco
10 GB
20 GB+
GPU
No requerido
Opcional (para modelos locales)
Despliegue rápido en CLORE.AI
Imagen de Docker: ghcr.io/berriai/litellm:main-latest
Puertos: 22/tcp, 4000/http
Variables de entorno:
OPENAI_API_KEY
sk-xxx...
Clave API de OpenAI
ANTHROPIC_API_KEY
sk-ant-xxx...
Clave API de Anthropic
AZURE_API_KEY
xxx...
Clave de Azure OpenAI
LITELLM_MASTER_KEY
sk-my-master-key
Clave maestra de autenticación para el proxy
DATABASE_URL
postgresql://...
PostgreSQL para seguimiento de costes
STORE_MODEL_IN_DB
True
Persistir la configuración del modelo en la base de datos
Configuración paso a paso
1. Alquila un servidor en CLORE.AI
LiteLLM funciona muy bien incluso en servidores solo con CPU. Ve a Marketplace de CLORE.AI y filtra por:
Servidores CPU de precio más bajo para una configuración de solo proxy
Servidores GPU (RTX 3090+) si también quieres ejecutar modelos locales
2. Conéctate por SSH a tu servidor
3. Crea un archivo de configuración
LiteLLM usa un archivo de configuración YAML para definir modelos:
4. Inicia LiteLLM
Inicio básico:
Con PostgreSQL para seguimiento de costes:
Primero, inicia un contenedor de PostgreSQL:
Usando Docker Compose (recomendado):
5. Verifica el servidor
6. Accede mediante el proxy HTTP de CLORE.AI
Tu URL http_pub de CLORE.AI para el puerto 4000:
Úsalo como tu api_base en cualquier cliente compatible con OpenAI.
Ejemplos de uso
Ejemplo 1: llamada directa a la API a través del proxy
Ejemplo 2: SDK de Python de OpenAI con el proxy LiteLLM
Ejemplo 3: SDK de Python de LiteLLM (directo)
Ejemplo 4: Configuración de fallback
Configura fallbacks automáticos entre modelos:
Ejemplo 5: Panel de seguimiento de costes
Después de habilitar PostgreSQL, accede al análisis del gasto:
Configuración
Claves virtuales (claves API por usuario)
Crea claves separadas con límites de tasa y presupuestos:
Balanceo de carga
Caché
Limitación de tasa
Consejos de rendimiento
1. Habilita la caché para prompts repetidos
Para aplicaciones RAG o chatbots con preguntas comunes, la caché de Redis reduce los costes entre un 30 y un 70 % y baja la latencia P50 a <5 ms en aciertos de caché:
2. Usa solicitudes asíncronas
3. Enrutamiento de modelos locales
Envía solicitudes baratas o sencillas a modelos locales en GPUs de Clore.ai, y las complejas a GPT-4:
Una configuración típica: ejecutar Mistral 7B o Llama 3 8B localmente en una RTX 3090 de Clore.ai ($0.07–0.21/h), gestionar allí el 80% del tráfico y escalar tareas complejas a GPT-4o. Son comunes ahorros de coste de 3–5× frente a solo nube.
4. Establece tiempos de espera y reintentos
Recomendaciones de GPU para Clore.ai
LiteLLM en sí no necesita GPU — es un proxy. La elección de la GPU solo importa cuando despliegas inferencia local junto a él.
Mistral 7B / Llama 3 8B (bf16)
RTX 3090 24 GB
Cabe cómodamente, rendimiento de ~200 tok/s
Mixtral 8×7B o Llama 3 70B (AWQ)
RTX 4090 24 GB
Ancho de banda de memoria más rápido que la 3090; cabe 70B AWQ de 4 bits
Llama 3 70B (bf16) o servicio de múltiples modelos
A100 80 GB
Ejecuta varios modelos 7–13B simultáneamente; HBM2e para baja latencia
Pila recomendada para un desarrollador independiente: RTX 3090 + Mistral 7B + puerta de enlace LiteLLM. Coste total en Clore.ai: $0.07–0.21/h. Gestiona ~50 req/min con facilidad, con fallback a GPT-4o para tareas complejas.
Pila de equipo / producción: A100 80GB, ejecuta Llama 3 70B + LiteLLM + PostgreSQL. Atiende a más de 20 usuarios concurrentes, seguimiento completo de costes y gasto en LLM de la nube nulo para la mayoría de las solicitudes.
Solución de problemas
Problema: "model not found"
Asegúrate de que el nombre del modelo en tu solicitud coincida exactamente con lo que hay en config.yaml:
Problema: "authentication failed"
Comprueba tu LITELLM_MASTER_KEY variable de entorno y úsala como token Bearer.
Problema: los cambios de configuración no se reflejan
Reinicia el contenedor después de los cambios de configuración:
Problema: alta latencia en la primera solicitud
LiteLLM carga las configuraciones del modelo al iniciarse. Las primeras solicitudes pueden ser más lentas mientras se establecen las conexiones.
Problema: errores de conexión a la base de datos
Problema: errores 429 de limitación de tasa de los proveedores
Configura fallbacks:
Recomendaciones de GPU para Clore.ai
LiteLLM es una puerta de enlace/proxy de API — no realiza inferencia por sí mismo. La elección de la GPU depende de si estás enrutando a APIs en la nube o a modelos locales.
Solo proxy de API en la nube
Solo CPU
~$0.02/hr
Enruta a OpenAI, Anthropic, Gemini — no se necesita GPU
Backend local de vLLM
RTX 3090 (24GB)
$0.07–0.21/h
Modelos autoalojados 7B–13B con LiteLLM como frontend
Backend local de vLLM
RTX 4090 (24GB)
$0.14–0.42/h
Modelos locales 7B–34B de mayor rendimiento
Enlaces
Última actualización
¿Te fue útil?