For the complete documentation index, see llms.txt. This page is also available as Markdown.

TGI (Text Generation Inference)

Ejecuta HuggingFace Text Generation Inference (TGI) para servir LLMs en producción en GPUs de Clore.ai

Text Generation Inference (TGI) es el marco de HuggingFace para servir LLM en producción, diseñado para inferencia de alto rendimiento y baja latencia. Soporta Flash Attention 2, batch continuo, PagedAttention y paralelismo de tensores de forma nativa — lo que lo convierte en la solución ideal para desplegar modelos de lenguaje grandes a escala en servidores GPU de CLORE.AI.

Requisitos del servidor

Parámetro
Mínimo
Recomendado

RAM

16 GB

32 GB+

VRAM

8 GB

24 GB+

Disco

50 GB

200 GB+

GPU

Cualquier NVIDIA (Ampere+ para Flash Attention)

A100, H100, RTX 4090

Flash Attention 2 requiere arquitectura Ampere o más reciente (RTX 3000+, A100, H100). Para GPUs más antiguas, TGI recurrirá automáticamente a la atención estándar.

Despliegue rápido en CLORE.AI

Imagen de Docker: ghcr.io/huggingface/text-generation-inference:latest

Puertos: 22/tcp, 8080/http

Variables de entorno:

Variable
Ejemplo
Descripción

MODEL_ID

mistralai/Mistral-7B-Instruct-v0.3

ID del modelo de HuggingFace

HF_TOKEN

hf_xxx...

Token de HuggingFace (para modelos restringidos)

NUM_SHARD

2

Número de GPUs para paralelismo de tensores

MAX_INPUT_LENGTH

4096

Máximo de tokens de entrada

MAX_TOTAL_TOKENS

8192

Máximo de tokens de entrada + salida

QUANTIZE

bitsandbytes-nf4

Método de cuantización

Configuración paso a paso

1. Alquila un servidor GPU en CLORE.AI

Ve a Marketplace de CLORE.AI y filtra servidores por:

  • VRAM ≥ 24 GB para modelos de 7B (precisión completa)

  • VRAM ≥ 12 GB para modelos de 7B (cuantización de 4 bits)

  • VRAM ≥ 80 GB para modelos de 70B (precisión completa, una sola GPU)

2. Conéctate vía SSH

Después de que se confirme tu pedido, conéctate a tu servidor usando los datos SSH de tu panel de CLORE.AI:

O usa el Terminal Web desde tu panel de pedidos de CLORE.AI.

3. Descarga la imagen Docker de TGI

4. Inicia TGI con un modelo

Inicio básico (Mistral 7B):

Con token de HuggingFace (para modelos restringidos como Llama 3):

Con cuantización de 4 bits (para menor VRAM):

Paralelismo de tensores en múltiples GPUs (para modelos de 70B):

5. Verifica que el servidor se esté ejecutando

Respuesta esperada: {"status":"ok"}

6. Accede mediante el proxy HTTP de CLORE.AI

En tu panel de pedidos de CLORE.AI, verás tu http_pub URL para el puerto 8080. Esto permite acceso desde navegador/API sin túnel SSH:


Ejemplos de uso

Ejemplo 1: Generación básica de texto

Ejemplo 2: Completions de chat (compatible con OpenAI)

TGI admite el formato de la API de completions de chat de OpenAI:

Ejemplo 3: Respuesta en streaming

Ejemplo 4: Cliente Python

Ejemplo 5: Solicitudes por lotes


Configuración

Parámetros clave de CLI

Parámetro
Valor predeterminado
Descripción

--model-id

requerido

ID del modelo de HuggingFace o ruta local

--num-shard

1

Número de fragmentos de GPU (paralelismo de tensores)

--max-concurrent-requests

128

Máximo de solicitudes simultáneas

--max-input-length

1024

Longitud máxima de tokens de entrada

--max-total-tokens

2048

Máximo de tokens de entrada + salida

--max-batch-total-tokens

auto

Máximo de tokens por lote

--quantize

ninguno

Cuantización: bitsandbytes-nf4, gptq, awq

--dtype

auto

float16, bfloat16

--trust-remote-code

false

Permitir código personalizado del modelo

--port

80

Puerto del servidor

Usando un modelo local

Si tienes un modelo descargado localmente:

Cuantización AWQ (más rápida que NF4)


Consejos de rendimiento

1. Habilita Flash Attention 2

Flash Attention 2 se habilita automáticamente en GPUs Ampere+ (RTX 3000+, A100, H100). No se necesita configuración adicional.

2. Ajusta el tamaño máximo de lote

Para escenarios de alto rendimiento, aumenta el tamaño del lote:

3. Usa bfloat16 en GPUs Ampere+

Es más estable numéricamente que float16 y rinde igual en GPUs modernas.

4. Pre-descarga los modelos al almacenamiento persistente

Luego monta la ruta local para evitar volver a descargar al reiniciar.

5. Gestión de memoria de la GPU

Para RTX 3090/4090 (24GB VRAM):

6. Decodificación especulativa

Para una generación más rápida con modelos pequeños como borrador:


Solución de problemas

Problema: "CUDA out of memory"

Solución: Reduce --max-total-tokens o habilita la cuantización:

Problema: la descarga del modelo es lenta

Solución: Usa un espejo de HuggingFace o pre-descarga:

Problema: el servidor no es accesible vía http_pub

Solución: Asegúrate de que el puerto 8080 esté mapeado correctamente. TGI escucha internamente en el puerto 80, pero lo asignas al 8080 externamente:

Problema: "trust_remote_code is required"

Algunos modelos (p. ej., Falcon, Phi) requieren código personalizado:

Problema: respuesta inicial lenta

La primera solicitud desencadena la carga del modelo en la VRAM. Esto es normal. Las solicitudes posteriores serán rápidas.

Problema: el contenedor se cierra inmediatamente


Enlaces


Recomendaciones de GPU para Clore.ai

Caso de uso
GPU recomendada
Costo estimado en Clore.ai

Desarrollo/Pruebas

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Producción (7B–13B)

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

Modelos grandes (70B+)

A100 80GB / H100

~$1.04/gpu/hr

💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.

Última actualización

¿Te fue útil?