ClearML
Descripción general
ClearML es una plataforma integral de gestión del ciclo de vida de ML de Allegro AI. Captura automáticamente los parámetros, métricas, artefactos y código de los experimentos con cambios mínimos en el código. ClearML admite todo el flujo de trabajo de ML: desde la gestión de datos y el seguimiento de experimentos hasta el registro de modelos, los pipelines automatizados y la ejecución distribuida de tareas en clústeres GPU.
Categoría
MLOps / Seguimiento de experimentos
Desarrollador
Allegro AI
Licencia
Apache 2.0
GitHub
Estrellas
5.5K+
Docker Hub
allegroai/clearml
Puertos
22 (SSH), 8008 (servidor API), 8081 (interfaz web)
Arquitectura
ClearML consta de cuatro componentes principales:
Servidor ClearML
—
Coordinador del backend
Interfaz web
8081
Panel de control basado en navegador
Servidor API
8008
API REST para el SDK y los agentes
Servidor de archivos
8081
Almacenamiento de artefactos y modelos
ClearML Agent
—
Trabajador que ejecuta tareas de ML
Características clave
Seguimiento de experimentos sin código — agrega 2 líneas de código para capturarlo todo automáticamente
Registro automático — métricas, parámetros, modelos, salida de consola, gráficos, imágenes
Integración con Git — captura automáticamente el commit de Git, el diff y los cambios no confirmados
Gestión de datos — conjuntos de datos versionados con seguimiento de linaje
Registro de modelos — almacena, versiona y sirve modelos de ML
Orquestación de pipelines — crea y ejecuta pipelines de ML de varios pasos
Ejecución remota — encola experimentos y ejecútalos en trabajadores GPU remotos (ClearML Agent)
Optimización de hiperparámetros — HPO automatizada con entrenamiento basado en población
Monitorización de recursos — monitorización de GPU/CPU/RAM por experimento
Autoalojado o en la nube — ejecuta tu propio servidor o usa la plataforma alojada de ClearML
Configuración de Clore.ai
Opción 1 — Servidor autoalojado completo
Ejecuta el servidor de ClearML en Clore.ai para tener control total.
Paso 1 — Elige un servidor
Solo servidor (sin entrenamiento)
Instancia de CPU
—
8 GB+
Servidor + entrenamiento
RTX 3080
10 GB
16 GB
Clúster MLOps completo
Múltiples GPUs
—
32 GB+
Paso 2 — Alquila un servidor en Clore.ai
Ve a clore.ai → Marketplace
Para el servidor componente: las instancias de CPU funcionan bien
Para trabajadores de entrenamiento: instancias GPU (RTX 3090, 4090, A100)
Abrir puertos: 22, 8008, 8081
Asegúrate de ≥ 50 GB de disco para artefactos de experimentos
Paso 3 — Despliega con Docker Compose
Crear docker-compose.yml:
Inicia el stack:
ClearML Server requiere ~4 GB de RAM para el stack completo (MongoDB + Elasticsearch + Redis + servidor API + interfaz web). Asegúrate de que tu instancia de Clore.ai tenga RAM suficiente.
Opción 2 — Usa ClearML alojado (gratis)
Para el seguimiento de experimentos sin ejecutar un servidor, usa el plan alojado gratuito:
Acceso a la interfaz
Panel web
Credenciales predeterminadas: crea tu cuenta en el primer inicio de sesión.
Servidor API
Vía SSH
Integración del SDK
Instalación
Configuración inicial
Introduce la URL de tu servidor (http://<server-ip>:8008) y las credenciales de API desde el panel.
O configúralo programáticamente:
Seguimiento de experimentos
Integración mínima (2 líneas)
Registro manual de métricas
Seguimiento de hiperparámetros
Gestión de datos
Registro de modelos
Orquestación de pipelines
ClearML Agent (trabajador)
Ejecuta un ClearML Agent en un servidor GPU para ejecutar los experimentos en cola:
En Clore.ai, levanta múltiples nodos GPU como agentes ClearML para crear un clúster de cómputo distribuido.
Optimización de hiperparámetros
Monitoreo y alertas
Solución de problemas
Elasticsearch no se inicia — Establece vm.max_map_count=262144 en el host: sysctl -w vm.max_map_count=262144. Añade a /etc/sysctl.conf para que sea persistente.
No se puede conectar al servidor — Verifica que los puertos 8008 y 8081 estén abiertos en la configuración de puertos de Clore.ai. Comprueba docker ps para asegurarte de que todos los contenedores estén en ejecución.
Conexión a MongoDB rechazada
Comprueba el contenedor de mongo: docker logs clearml_mongo_1
Tarea atascada en la cola
Asegúrate de que ClearML Agent esté en ejecución y conectado a la cola
Interfaz de usuario lenta
Elasticsearch necesita tiempo para indexar — espera 2–3 min después de iniciar
API 401 No autorizado
Regenera las credenciales de la API en el panel web de ClearML
Casos de uso para investigadores de GPU
Haz seguimiento de las ejecuciones de entrenamiento — nunca vuelvas a perder hiperparámetros ni resultados
Compara experimentos — comparación de métricas lado a lado en la interfaz de usuario
Reproduce resultados — ClearML captura automáticamente el commit de git + el diff del código
Comparte resultados — los colaboradores ven todos los experimentos en el panel compartido
Trabajos remotos en GPU — encola trabajos de entrenamiento desde el portátil, ejecútalos en nodos GPU de Clore.ai
HPO automatizado — ejecuta búsqueda de hiperparámetros en paralelo en múltiples nodos GPU
Herramientas relacionadas
MLflow — alternativa de seguimiento de experimentos
Weights & Biases — seguimiento de experimentos de ML alojado
Ray — entrenamiento distribuido de ML y HPO
ClearML en Clore.ai combina el seguimiento de experimentos con la gestión de cómputo GPU — brindando a tu equipo de ML capacidades completas de MLOps sin dependencia de un proveedor de nube.
Recomendaciones de GPU para Clore.ai
Desarrollo/Pruebas
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Entrenamiento en producción
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.
Última actualización
¿Te fue útil?