For the complete documentation index, see llms.txt. This page is also available as Markdown.

Pasarela de IA LiteLLM

Despliega LiteLLM como proxy de pasarela de IA para más de 100 LLMs en GPUs de Clore.ai

LiteLLM es una puerta de enlace de IA de código abierto que proporciona una API unificada compatible con OpenAI para más de 100 proveedores de modelos de lenguaje, incluidos OpenAI, Anthropic, Azure, Bedrock, HuggingFace y modelos alojados localmente. Despliega esto en CLORE.AI para enrutar, equilibrar la carga y gestionar todas tus llamadas a la API de LLM a través de un único endpoint con seguimiento de costes integrado, limitación de tasa y lógica de fallback.

El verdadero poder de LiteLLM se ve a escala: los equipos que ejecutan pilas mixtas local+nube pueden intercambiar modelos al vuelo sin tocar el código de la aplicación. Reemplaza gpt-4o con mistral-7b-local en la configuración, reinicia — hecho.

Requisitos del servidor

Parámetro
Mínimo
Recomendado

RAM

4 GB

8 GB+

VRAM

N/A (solo proxy)

N/A

Disco

10 GB

20 GB+

GPU

No requerido

Opcional (para modelos locales)

LiteLLM en sí es un proxy basado en CPU y no requiere una GPU. Sin embargo, desplegarlo en un servidor GPU de CLORE.AI tiene sentido cuando quieres ejecutar modelos locales (vía Ollama, TGI, vLLM) junto con LiteLLM como una puerta de enlace unificada en la misma máquina.

Despliegue rápido en CLORE.AI

Imagen de Docker: ghcr.io/berriai/litellm:main-latest

Puertos: 22/tcp, 4000/http

Variables de entorno:

Variable
Ejemplo
Descripción

OPENAI_API_KEY

sk-xxx...

Clave API de OpenAI

ANTHROPIC_API_KEY

sk-ant-xxx...

Clave API de Anthropic

AZURE_API_KEY

xxx...

Clave de Azure OpenAI

LITELLM_MASTER_KEY

sk-my-master-key

Clave maestra de autenticación para el proxy

DATABASE_URL

postgresql://...

PostgreSQL para seguimiento de costes

STORE_MODEL_IN_DB

True

Persistir la configuración del modelo en la base de datos

Configuración paso a paso

1. Alquila un servidor en CLORE.AI

LiteLLM funciona muy bien incluso en servidores solo con CPU. Ve a Marketplace de CLORE.AI y filtra por:

  • Servidores CPU de precio más bajo para una configuración de solo proxy

  • Servidores GPU (RTX 3090+) si también quieres ejecutar modelos locales

2. Conéctate por SSH a tu servidor

3. Crea un archivo de configuración

LiteLLM usa un archivo de configuración YAML para definir modelos:

4. Inicia LiteLLM

Inicio básico:

Con PostgreSQL para seguimiento de costes:

Primero, inicia un contenedor de PostgreSQL:

Usando Docker Compose (recomendado):

5. Verifica el servidor

6. Accede mediante el proxy HTTP de CLORE.AI

Tu URL http_pub de CLORE.AI para el puerto 4000:

Úsalo como tu api_base en cualquier cliente compatible con OpenAI.


Ejemplos de uso

Ejemplo 1: llamada directa a la API a través del proxy

Ejemplo 2: SDK de Python de OpenAI con el proxy LiteLLM

Ejemplo 3: SDK de Python de LiteLLM (directo)

Ejemplo 4: Configuración de fallback

Configura fallbacks automáticos entre modelos:

Ejemplo 5: Panel de seguimiento de costes

Después de habilitar PostgreSQL, accede al análisis del gasto:


Configuración

Claves virtuales (claves API por usuario)

Crea claves separadas con límites de tasa y presupuestos:

Balanceo de carga

Caché

Limitación de tasa


Consejos de rendimiento

1. Habilita la caché para prompts repetidos

Para aplicaciones RAG o chatbots con preguntas comunes, la caché de Redis reduce los costes entre un 30 y un 70 % y baja la latencia P50 a <5 ms en aciertos de caché:

2. Usa solicitudes asíncronas

3. Enrutamiento de modelos locales

Envía solicitudes baratas o sencillas a modelos locales en GPUs de Clore.ai, y las complejas a GPT-4:

Una configuración típica: ejecutar Mistral 7B o Llama 3 8B localmente en una RTX 3090 de Clore.ai ($0.07–0.21/h), gestionar allí el 80% del tráfico y escalar tareas complejas a GPT-4o. Son comunes ahorros de coste de 3–5× frente a solo nube.

4. Establece tiempos de espera y reintentos


Recomendaciones de GPU para Clore.ai

LiteLLM en sí no necesita GPU — es un proxy. La elección de la GPU solo importa cuando despliegas inferencia local junto a él.

Modelo local
GPU
Por qué

Mistral 7B / Llama 3 8B (bf16)

RTX 3090 24 GB

Cabe cómodamente, rendimiento de ~200 tok/s

Mixtral 8×7B o Llama 3 70B (AWQ)

RTX 4090 24 GB

Ancho de banda de memoria más rápido que la 3090; cabe 70B AWQ de 4 bits

Llama 3 70B (bf16) o servicio de múltiples modelos

A100 80 GB

Ejecuta varios modelos 7–13B simultáneamente; HBM2e para baja latencia

Pila recomendada para un desarrollador independiente: RTX 3090 + Mistral 7B + puerta de enlace LiteLLM. Coste total en Clore.ai: $0.07–0.21/h. Gestiona ~50 req/min con facilidad, con fallback a GPT-4o para tareas complejas.

Pila de equipo / producción: A100 80GB, ejecuta Llama 3 70B + LiteLLM + PostgreSQL. Atiende a más de 20 usuarios concurrentes, seguimiento completo de costes y gasto en LLM de la nube nulo para la mayoría de las solicitudes.


Solución de problemas

Problema: "model not found"

Asegúrate de que el nombre del modelo en tu solicitud coincida exactamente con lo que hay en config.yaml:

Problema: "authentication failed"

Comprueba tu LITELLM_MASTER_KEY variable de entorno y úsala como token Bearer.

Problema: los cambios de configuración no se reflejan

Reinicia el contenedor después de los cambios de configuración:

Problema: alta latencia en la primera solicitud

LiteLLM carga las configuraciones del modelo al iniciarse. Las primeras solicitudes pueden ser más lentas mientras se establecen las conexiones.

Problema: errores de conexión a la base de datos

Problema: errores 429 de limitación de tasa de los proveedores

Configura fallbacks:


Recomendaciones de GPU para Clore.ai

LiteLLM es una puerta de enlace/proxy de API — no realiza inferencia por sí mismo. La elección de la GPU depende de si estás enrutando a APIs en la nube o a modelos locales.

Configuración
GPU
Precio de Clore.ai
Caso de uso

Solo proxy de API en la nube

Solo CPU

~$0.02/hr

Enruta a OpenAI, Anthropic, Gemini — no se necesita GPU

Backend local de vLLM

RTX 3090 (24GB)

$0.07–0.21/h

Modelos autoalojados 7B–13B con LiteLLM como frontend

Backend local de vLLM

RTX 4090 (24GB)

$0.14–0.42/h

Modelos locales 7B–34B de mayor rendimiento

Backend local de vLLM

A100 40GB

Modelos 70B, servicio local para producción

Configuración más común: Ejecuta LiteLLM como un proxy unificado delante de tus instancias vLLM/Ollama alojadas en Clore.ai. Esto te da fallbacks de proveedor, limitación de tasa, seguimiento de costes y enrutamiento compatible con OpenAI — manteniendo toda la inferencia local y barata.

Ejemplo de coste: Ejecuta el proxy LiteLLM en una instancia solo CPU ($0.07–0.21/h) y apúntalo a un servidor vLLM en una RTX 3090 ($0.07–0.21/h). Coste total de $0.07–0.21/h para una API de LLM autoalojada y lista para producción con fallbacks, registro y limitación de tasa.


Enlaces

Última actualización

¿Te fue útil?