For the complete documentation index, see llms.txt. This page is also available as Markdown.

Triton Inference Server

Servidor de inferencia NVIDIA Triton es una plataforma de inferencia de código abierto y de nivel de producción que admite prácticamente todos los principales frameworks de ML. Diseñado para servir con alto rendimiento y baja latencia, Triton maneja PyTorch, TensorFlow, ONNX, TensorRT, OpenVINO y más, todo desde un único proceso de servidor. Despliégalo en la nube de GPU de Clore.ai para una infraestructura de inferencia escalable y rentable.


¿Qué es Triton Inference Server?

Triton es la respuesta de NVIDIA al desafío de servir modelos de ML a escala:

  • Multiframework: PyTorch, TensorFlow, TensorRT, ONNX, OpenVINO, backends personalizados en Python

  • Ejecución concurrente: Varios modelos, varias instancias por GPU

  • Batching dinámico: Agrupa automáticamente las solicitudes para mayor rendimiento

  • gRPC + HTTP: Protocolos estándar de la industria listos para usar

  • Métricas: Endpoint de métricas compatible con Prometheus

  • Repositorio de modelos: Gestión de modelos basada en el sistema de archivos

Puertos utilizados:

Puerto
Protocolo
Propósito

8000

HTTP

API REST de inferencia

8001

gRPC

API gRPC de inferencia

8002

HTTP

Métricas de Prometheus


Requisitos previos

Requisito
Mínimo
Recomendado

VRAM de GPU

8 GB

16–24 GB

GPU

Cualquier NVIDIA con CUDA 11+

RTX 4090 / A100

RAM

16 GB

32 GB

Almacenamiento

20 GB

50 GB

Triton también admite inferencia solo en CPU para cargas de trabajo que no usan CUDA. Usa la solo-CPU variante de la imagen de Docker para ahorrar costos en trabajos por lotes que no requieren GPU.


Paso 1 — Alquila una GPU en Clore.ai

  1. Inicia sesión en clore.ai.

  2. Haz clic en Marketplace y filtra por VRAM ≥ 16 GB.

  3. Selecciona un servidor y haz clic en Configurar.

  4. Establece la imagen de Docker: nvcr.io/nvidia/tritonserver:24.01-py3

    • (Reemplaza 24.01 por la versión más reciente — consulta catálogo NGC)

  5. Establece los puertos abiertos: 22 (SSH), 8000 (HTTP), 8001 (gRPC), 8002 (métricas).

  6. Haz clic en Alquilar.


Paso 2 — Dockerfile personalizado (con SSH)

La imagen oficial de Triton no incluye un servidor SSH. Usa este Dockerfile:


Paso 3 — Comprende el repositorio de modelos

Triton carga los modelos desde un repositorio de modelos — un directorio con una estructura específica:

Cada modelo necesita:

  1. Un directorio con el nombre del modelo

  2. Un config.pbtxt archivo de configuración

  3. Al menos un subdirectorio de versión (por ejemplo, 1/) con el archivo del modelo


Paso 4 — Despliega un modelo PyTorch

Exportar el modelo a TorchScript

Configurar el repositorio de modelos

Crear config.pbtxt


Paso 5 — Despliega un modelo ONNX

Exportar a ONNX

Configuración de ONNX


Paso 6 — Despliega un backend personalizado en Python

Para modelos que no encajan en los backends estándar (preprocesamiento personalizado, lógica de ensemble):


Paso 7 — Inicia Triton y prueba

Iniciar el servidor Triton

Comprobar los modelos disponibles

Ejecutar inferencia vía HTTP

Ejecutar inferencia vía gRPC


Monitorización con Prometheus

Triton expone métricas en el puerto 8002:

Métricas clave:


Configuración de batching dinámico


Solución de problemas

Fallo al cargar el modelo

Solución: Comprueba la estructura de directorios y los permisos:

Incompatibilidad con CUDA

Solución: Haz coincidir la versión de la imagen Triton con tu controlador CUDA:

Puerto no accesible

Solución: Verifica que los tres puertos (8000, 8001, 8002) estén redirigidos en Clore.ai. Prueba cada uno:

OOM durante la carga del modelo

Solución: Reduce el número de instancias o usa instancias de CPU para algunos modelos:


Estimación de costos

GPU
VRAM
Precio estimado
Rendimiento (ResNet50)

RTX 3080

10 GB

$0,05–0,19/h

~500 solicitudes/seg

RTX 4090

24 GB

$0.14–0.42/h

~1500 solicitudes/seg

A100 40GB

40 GB

~3000 solicitudes/seg

H100

80 GB

~$1.04/h

~8000 solicitudes/seg


Recursos útiles


Recomendaciones de GPU para Clore.ai

Caso de uso
GPU recomendada
Costo estimado en Clore.ai

Desarrollo/Pruebas

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Inferencia en producción

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

Modelos grandes (70B+)

A100 80GB

💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.

Última actualización

¿Te fue útil?