TGI (Text Generation Inference)
Ejecuta HuggingFace Text Generation Inference (TGI) para servir LLMs en producción en GPUs de Clore.ai
Text Generation Inference (TGI) es el marco de HuggingFace para servir LLM en producción, diseñado para inferencia de alto rendimiento y baja latencia. Soporta Flash Attention 2, batch continuo, PagedAttention y paralelismo de tensores de forma nativa — lo que lo convierte en la solución ideal para desplegar modelos de lenguaje grandes a escala en servidores GPU de CLORE.AI.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Requisitos del servidor
RAM
16 GB
32 GB+
VRAM
8 GB
24 GB+
Disco
50 GB
200 GB+
GPU
Cualquier NVIDIA (Ampere+ para Flash Attention)
A100, H100, RTX 4090
Despliegue rápido en CLORE.AI
Imagen de Docker: ghcr.io/huggingface/text-generation-inference:latest
Puertos: 22/tcp, 8080/http
Variables de entorno:
MODEL_ID
mistralai/Mistral-7B-Instruct-v0.3
ID del modelo de HuggingFace
HF_TOKEN
hf_xxx...
Token de HuggingFace (para modelos restringidos)
NUM_SHARD
2
Número de GPUs para paralelismo de tensores
MAX_INPUT_LENGTH
4096
Máximo de tokens de entrada
MAX_TOTAL_TOKENS
8192
Máximo de tokens de entrada + salida
QUANTIZE
bitsandbytes-nf4
Método de cuantización
Configuración paso a paso
1. Alquila un servidor GPU en CLORE.AI
Ve a Marketplace de CLORE.AI y filtra servidores por:
VRAM ≥ 24 GB para modelos de 7B (precisión completa)
VRAM ≥ 12 GB para modelos de 7B (cuantización de 4 bits)
VRAM ≥ 80 GB para modelos de 70B (precisión completa, una sola GPU)
2. Conéctate vía SSH
Después de que se confirme tu pedido, conéctate a tu servidor usando los datos SSH de tu panel de CLORE.AI:
O usa el Terminal Web desde tu panel de pedidos de CLORE.AI.
3. Descarga la imagen Docker de TGI
4. Inicia TGI con un modelo
Inicio básico (Mistral 7B):
Con token de HuggingFace (para modelos restringidos como Llama 3):
Con cuantización de 4 bits (para menor VRAM):
Paralelismo de tensores en múltiples GPUs (para modelos de 70B):
5. Verifica que el servidor se esté ejecutando
Respuesta esperada: {"status":"ok"}
6. Accede mediante el proxy HTTP de CLORE.AI
En tu panel de pedidos de CLORE.AI, verás tu http_pub URL para el puerto 8080. Esto permite acceso desde navegador/API sin túnel SSH:
Ejemplos de uso
Ejemplo 1: Generación básica de texto
Ejemplo 2: Completions de chat (compatible con OpenAI)
TGI admite el formato de la API de completions de chat de OpenAI:
Ejemplo 3: Respuesta en streaming
Ejemplo 4: Cliente Python
Ejemplo 5: Solicitudes por lotes
Configuración
Parámetros clave de CLI
--model-id
requerido
ID del modelo de HuggingFace o ruta local
--num-shard
1
Número de fragmentos de GPU (paralelismo de tensores)
--max-concurrent-requests
128
Máximo de solicitudes simultáneas
--max-input-length
1024
Longitud máxima de tokens de entrada
--max-total-tokens
2048
Máximo de tokens de entrada + salida
--max-batch-total-tokens
auto
Máximo de tokens por lote
--quantize
ninguno
Cuantización: bitsandbytes-nf4, gptq, awq
--dtype
auto
float16, bfloat16
--trust-remote-code
false
Permitir código personalizado del modelo
--port
80
Puerto del servidor
Usando un modelo local
Si tienes un modelo descargado localmente:
Cuantización AWQ (más rápida que NF4)
Consejos de rendimiento
1. Habilita Flash Attention 2
Flash Attention 2 se habilita automáticamente en GPUs Ampere+ (RTX 3000+, A100, H100). No se necesita configuración adicional.
2. Ajusta el tamaño máximo de lote
Para escenarios de alto rendimiento, aumenta el tamaño del lote:
3. Usa bfloat16 en GPUs Ampere+
Es más estable numéricamente que float16 y rinde igual en GPUs modernas.
4. Pre-descarga los modelos al almacenamiento persistente
Luego monta la ruta local para evitar volver a descargar al reiniciar.
5. Gestión de memoria de la GPU
Para RTX 3090/4090 (24GB VRAM):
6. Decodificación especulativa
Para una generación más rápida con modelos pequeños como borrador:
Solución de problemas
Problema: "CUDA out of memory"
Solución: Reduce --max-total-tokens o habilita la cuantización:
Problema: la descarga del modelo es lenta
Solución: Usa un espejo de HuggingFace o pre-descarga:
Problema: el servidor no es accesible vía http_pub
Solución: Asegúrate de que el puerto 8080 esté mapeado correctamente. TGI escucha internamente en el puerto 80, pero lo asignas al 8080 externamente:
Problema: "trust_remote_code is required"
Algunos modelos (p. ej., Falcon, Phi) requieren código personalizado:
Problema: respuesta inicial lenta
La primera solicitud desencadena la carga del modelo en la VRAM. Esto es normal. Las solicitudes posteriores serán rápidas.
Problema: el contenedor se cierra inmediatamente
Enlaces
Recomendaciones de GPU para Clore.ai
Desarrollo/Pruebas
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Producción (7B–13B)
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
Modelos grandes (70B+)
A100 80GB / H100
~$1.04/gpu/hr
💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.
Última actualización
¿Te fue útil?