Entrenamiento con DeepSpeed
Entrena modelos grandes de forma eficiente con DeepSpeed en GPUs de Clore.ai
Entrena modelos grandes de forma eficiente con Microsoft DeepSpeed.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Alquilar en CLORE.AI
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Visita Marketplace de CLORE.AI
Filtra por tipo de GPU, VRAM y precio
Elige Bajo demanda (tarifa fija) o Spot (precio ofertado)
Configura tu pedido:
Selecciona la imagen de Docker
Configura los puertos (TCP para SSH, HTTP para interfaces web)
Añade variables de entorno si es necesario
Introduce el comando de inicio
Selecciona el método de pago: CLORE, BTC, o USDT/USDC
Crea el pedido y espera al despliegue
Accede a tu servidor
Encuentra los detalles de conexión en Mis pedidos
Interfaces web: Usa la URL del puerto HTTP
SSH:
ssh -p <port> root@<proxy-address>
¿Qué es DeepSpeed?
DeepSpeed permite:
Entrenar modelos que no caben en la memoria GPU
Entrenamiento multi-GPU y multinodo
Optimización ZeRO (eficiencia de memoria)
Entrenamiento con precisión mixta
Etapas de ZeRO
ZeRO-1
Estados del optimizador particionados
Rápido
ZeRO-2
+ Gradientes particionados
Equilibrado
ZeRO-3
+ Parámetros particionados
Máximo ahorro
ZeRO-Infinity
Descarga a CPU/NVMe
Modelos más grandes
Despliegue rápido
Imagen de Docker:
Puertos:
Comando:
Instalación
Entrenamiento básico
Configuración de DeepSpeed
ds_config.json:
Script de entrenamiento
Configuración de ZeRO Etapa 2
Configuración de ZeRO Etapa 3
Para modelos grandes:
Con Hugging Face Transformers
Integración con Trainer
Entrenamiento multi-GPU
Comando de inicio
Con torchrun
Entrenamiento multinodo
Archivo de hosts
hostfile:
Iniciar
Configuración SSH
Configuraciones eficientes en memoria
Modelo de 7B en GPU de 24 GB
Modelo de 13B en GPU de 24 GB
Punto de control de gradiente
Ahorra memoria recomputando activaciones:
Guardar y cargar puntos de control
Guardar
Cargar
Guardar en formato Hugging Face
Monitoreo
TensorBoard
Weights & Biases
Problemas comunes
Sin memoria
Entrenamiento lento
Reduce la descarga a CPU
Aumenta el tamaño del lote
Usa ZeRO Etapa 2 en lugar de 3
Errores de NCCL
Consejos de rendimiento
Usa bf16 en lugar de fp16
Mejor estabilidad
Activa el checkpointing de gradiente
Menos memoria
Ajusta el tamaño del lote
Mejor rendimiento
Usa descarga a NVMe
Modelos más grandes
Comparación de rendimiento
7B
1x A100
ZeRO-3
~1000 tokens/s
7B
4x A100
ZeRO-2
~4000 tokens/s
13B
4x A100
ZeRO-3
~2000 tokens/s
70B
8x A100
ZeRO-3
~800 tokens/s
Solución de problemas
Estimación de costos
Tarifas típicas del marketplace de CLORE.AI (a partir de 2024):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
Los precios varían según el proveedor y la demanda. Consulta Marketplace de CLORE.AI las tarifas actuales.
Ahorra dinero:
Usa el Spot mercado para trabajo interrumpible — alrededor de un tercio de los servidores fija el precio spot por debajo del precio bajo demanda (mediana de ~13% de descuento), el resto lo iguala
Paga con CLORE tokens
Compara precios entre distintos proveedores
Siguientes pasos
Ajuste fino de LLMs - Entrenamiento LoRA
Inferencia con vLLM - Desplegar el modelo entrenado
Guía de Hugging Face - Biblioteca Transformers
Última actualización
¿Te fue útil?