For the complete documentation index, see llms.txt. This page is also available as Markdown.

ClearML

ClearML (anteriormente Trains) es una plataforma de MLOps de código abierto para el seguimiento de experimentos, el versionado de datos, la gestión de modelos, la orquestación de pipelines y la gestión de recursos de cómputo — todo en una suite unificada.

Descripción general

ClearML es una plataforma integral de gestión del ciclo de vida de ML de Allegro AI. Captura automáticamente los parámetros, métricas, artefactos y código de los experimentos con cambios mínimos en el código. ClearML admite todo el flujo de trabajo de ML: desde la gestión de datos y el seguimiento de experimentos hasta el registro de modelos, los pipelines automatizados y la ejecución distribuida de tareas en clústeres GPU.

Propiedad
Valor

Categoría

MLOps / Seguimiento de experimentos

Desarrollador

Allegro AI

Licencia

Apache 2.0

Estrellas

5.5K+

Docker Hub

allegroai/clearml

Puertos

22 (SSH), 8008 (servidor API), 8081 (interfaz web)


Arquitectura

ClearML consta de cuatro componentes principales:

Componente
Puerto
Descripción

Servidor ClearML

Coordinador del backend

Interfaz web

8081

Panel de control basado en navegador

Servidor API

8008

API REST para el SDK y los agentes

Servidor de archivos

8081

Almacenamiento de artefactos y modelos

ClearML Agent

Trabajador que ejecuta tareas de ML


Características clave

  • Seguimiento de experimentos sin código — agrega 2 líneas de código para capturarlo todo automáticamente

  • Registro automático — métricas, parámetros, modelos, salida de consola, gráficos, imágenes

  • Integración con Git — captura automáticamente el commit de Git, el diff y los cambios no confirmados

  • Gestión de datos — conjuntos de datos versionados con seguimiento de linaje

  • Registro de modelos — almacena, versiona y sirve modelos de ML

  • Orquestación de pipelines — crea y ejecuta pipelines de ML de varios pasos

  • Ejecución remota — encola experimentos y ejecútalos en trabajadores GPU remotos (ClearML Agent)

  • Optimización de hiperparámetros — HPO automatizada con entrenamiento basado en población

  • Monitorización de recursos — monitorización de GPU/CPU/RAM por experimento

  • Autoalojado o en la nube — ejecuta tu propio servidor o usa la plataforma alojada de ClearML


Configuración de Clore.ai

Opción 1 — Servidor autoalojado completo

Ejecuta el servidor de ClearML en Clore.ai para tener control total.

Paso 1 — Elige un servidor

Caso de uso
Recomendado
VRAM
RAM

Solo servidor (sin entrenamiento)

Instancia de CPU

8 GB+

Servidor + entrenamiento

RTX 3080

10 GB

16 GB

Clúster MLOps completo

Múltiples GPUs

32 GB+

Paso 2 — Alquila un servidor en Clore.ai

  1. Ve a clore.aiMarketplace

  2. Para el servidor componente: las instancias de CPU funcionan bien

  3. Para trabajadores de entrenamiento: instancias GPU (RTX 3090, 4090, A100)

  4. Abrir puertos: 22, 8008, 8081

  5. Asegúrate de ≥ 50 GB de disco para artefactos de experimentos

Paso 3 — Despliega con Docker Compose

Crear docker-compose.yml:

Inicia el stack:

Opción 2 — Usa ClearML alojado (gratis)

Para el seguimiento de experimentos sin ejecutar un servidor, usa el plan alojado gratuito:


Acceso a la interfaz

Panel web

Credenciales predeterminadas: crea tu cuenta en el primer inicio de sesión.

Servidor API

Vía SSH


Integración del SDK

Instalación

Configuración inicial

Introduce la URL de tu servidor (http://<server-ip>:8008) y las credenciales de API desde el panel.

O configúralo programáticamente:


Seguimiento de experimentos

Integración mínima (2 líneas)

Registro manual de métricas

Seguimiento de hiperparámetros


Gestión de datos


Registro de modelos


Orquestación de pipelines


ClearML Agent (trabajador)

Ejecuta un ClearML Agent en un servidor GPU para ejecutar los experimentos en cola:

En Clore.ai, levanta múltiples nodos GPU como agentes ClearML para crear un clúster de cómputo distribuido.


Optimización de hiperparámetros


Monitoreo y alertas


Solución de problemas

Los experimentos no aparecen en la interfaz. — Verifica que CLEARML_API_HOST en la configuración de tu SDK apunta a http://<server-ip>:8008, no a localhost.

Sin espacio en disco — ClearML almacena todos los artefactos localmente. Configura almacenamiento S3/GCS o aumenta la asignación de disco en Clore.ai.

Problema
Solución

Conexión a MongoDB rechazada

Comprueba el contenedor de mongo: docker logs clearml_mongo_1

Tarea atascada en la cola

Asegúrate de que ClearML Agent esté en ejecución y conectado a la cola

Interfaz de usuario lenta

Elasticsearch necesita tiempo para indexar — espera 2–3 min después de iniciar

API 401 No autorizado

Regenera las credenciales de la API en el panel web de ClearML


Casos de uso para investigadores de GPU

  • Haz seguimiento de las ejecuciones de entrenamiento — nunca vuelvas a perder hiperparámetros ni resultados

  • Compara experimentos — comparación de métricas lado a lado en la interfaz de usuario

  • Reproduce resultados — ClearML captura automáticamente el commit de git + el diff del código

  • Comparte resultados — los colaboradores ven todos los experimentos en el panel compartido

  • Trabajos remotos en GPU — encola trabajos de entrenamiento desde el portátil, ejecútalos en nodos GPU de Clore.ai

  • HPO automatizado — ejecuta búsqueda de hiperparámetros en paralelo en múltiples nodos GPU


Herramientas relacionadas

  • MLflow — alternativa de seguimiento de experimentos

  • Weights & Biases — seguimiento de experimentos de ML alojado

  • Ray — entrenamiento distribuido de ML y HPO


ClearML en Clore.ai combina el seguimiento de experimentos con la gestión de cómputo GPU — brindando a tu equipo de ML capacidades completas de MLOps sin dependencia de un proveedor de nube.


Recomendaciones de GPU para Clore.ai

Caso de uso
GPU recomendada
Costo estimado en Clore.ai

Desarrollo/Pruebas

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Entrenamiento en producción

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

Experimentos a gran escala

A100 80GB

💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.

Última actualización

¿Te fue útil?