Triton Inference Server
Servidor de inferencia NVIDIA Triton es una plataforma de inferencia de código abierto y de nivel de producción que admite prácticamente todos los principales frameworks de ML. Diseñado para servir con alto rendimiento y baja latencia, Triton maneja PyTorch, TensorFlow, ONNX, TensorRT, OpenVINO y más, todo desde un único proceso de servidor. Despliégalo en la nube de GPU de Clore.ai para una infraestructura de inferencia escalable y rentable.
¿Qué es Triton Inference Server?
Triton es la respuesta de NVIDIA al desafío de servir modelos de ML a escala:
Multiframework: PyTorch, TensorFlow, TensorRT, ONNX, OpenVINO, backends personalizados en Python
Ejecución concurrente: Varios modelos, varias instancias por GPU
Batching dinámico: Agrupa automáticamente las solicitudes para mayor rendimiento
gRPC + HTTP: Protocolos estándar de la industria listos para usar
Métricas: Endpoint de métricas compatible con Prometheus
Repositorio de modelos: Gestión de modelos basada en el sistema de archivos
Puertos utilizados:
8000
HTTP
API REST de inferencia
8001
gRPC
API gRPC de inferencia
8002
HTTP
Métricas de Prometheus
Requisitos previos
VRAM de GPU
8 GB
16–24 GB
GPU
Cualquier NVIDIA con CUDA 11+
RTX 4090 / A100
RAM
16 GB
32 GB
Almacenamiento
20 GB
50 GB
Paso 1 — Alquila una GPU en Clore.ai
Inicia sesión en clore.ai.
Haz clic en Marketplace y filtra por VRAM ≥ 16 GB.
Selecciona un servidor y haz clic en Configurar.
Establece la imagen de Docker:
nvcr.io/nvidia/tritonserver:24.01-py3(Reemplaza
24.01por la versión más reciente — consulta catálogo NGC)
Establece los puertos abiertos:
22(SSH),8000(HTTP),8001(gRPC),8002(métricas).Haz clic en Alquilar.
Las imágenes Docker de Triton son grandes (~15–20 GB). Permite 3–5 minutos para la descarga inicial en el primer inicio. Los inicios posteriores son rápidos.
Paso 2 — Dockerfile personalizado (con SSH)
La imagen oficial de Triton no incluye un servidor SSH. Usa este Dockerfile:
Paso 3 — Comprende el repositorio de modelos
Triton carga los modelos desde un repositorio de modelos — un directorio con una estructura específica:
Cada modelo necesita:
Un directorio con el nombre del modelo
Un
config.pbtxtarchivo de configuraciónAl menos un subdirectorio de versión (por ejemplo,
1/) con el archivo del modelo
Paso 4 — Despliega un modelo PyTorch
Exportar el modelo a TorchScript
Configurar el repositorio de modelos
Crear config.pbtxt
Paso 5 — Despliega un modelo ONNX
Exportar a ONNX
Configuración de ONNX
Paso 6 — Despliega un backend personalizado en Python
Para modelos que no encajan en los backends estándar (preprocesamiento personalizado, lógica de ensemble):
Paso 7 — Inicia Triton y prueba
Iniciar el servidor Triton
Comprobar los modelos disponibles
Ejecutar inferencia vía HTTP
Ejecutar inferencia vía gRPC
Monitorización con Prometheus
Triton expone métricas en el puerto 8002:
Métricas clave:
Configuración de batching dinámico
Solución de problemas
Fallo al cargar el modelo
Solución: Comprueba la estructura de directorios y los permisos:
Incompatibilidad con CUDA
Solución: Haz coincidir la versión de la imagen Triton con tu controlador CUDA:
Puerto no accesible
Solución: Verifica que los tres puertos (8000, 8001, 8002) estén redirigidos en Clore.ai. Prueba cada uno:
OOM durante la carga del modelo
Solución: Reduce el número de instancias o usa instancias de CPU para algunos modelos:
Estimación de costos
RTX 3080
10 GB
$0,05–0,19/h
~500 solicitudes/seg
RTX 4090
24 GB
$0.14–0.42/h
~1500 solicitudes/seg
H100
80 GB
~$1.04/h
~8000 solicitudes/seg
Recursos útiles
Recomendaciones de GPU para Clore.ai
Desarrollo/Pruebas
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Inferencia en producción
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.
Última actualización
¿Te fue útil?