For the complete documentation index, see llms.txt. This page is also available as Markdown.

Entrenamiento con DeepSpeed

Entrena modelos grandes de forma eficiente con DeepSpeed en GPUs de Clore.ai

Entrena modelos grandes de forma eficiente con Microsoft DeepSpeed.

Alquilar en CLORE.AI

  1. Filtra por tipo de GPU, VRAM y precio

  2. Elige Bajo demanda (tarifa fija) o Spot (precio ofertado)

  3. Configura tu pedido:

    • Selecciona la imagen de Docker

    • Configura los puertos (TCP para SSH, HTTP para interfaces web)

    • Añade variables de entorno si es necesario

    • Introduce el comando de inicio

  4. Selecciona el método de pago: CLORE, BTC, o USDT/USDC

  5. Crea el pedido y espera al despliegue

Accede a tu servidor

  • Encuentra los detalles de conexión en Mis pedidos

  • Interfaces web: Usa la URL del puerto HTTP

  • SSH: ssh -p <port> root@<proxy-address>

¿Qué es DeepSpeed?

DeepSpeed permite:

  • Entrenar modelos que no caben en la memoria GPU

  • Entrenamiento multi-GPU y multinodo

  • Optimización ZeRO (eficiencia de memoria)

  • Entrenamiento con precisión mixta

Etapas de ZeRO

Etapa
Ahorro de memoria
Velocidad

ZeRO-1

Estados del optimizador particionados

Rápido

ZeRO-2

+ Gradientes particionados

Equilibrado

ZeRO-3

+ Parámetros particionados

Máximo ahorro

ZeRO-Infinity

Descarga a CPU/NVMe

Modelos más grandes

Despliegue rápido

Imagen de Docker:

Puertos:

Comando:

Instalación

Entrenamiento básico

Configuración de DeepSpeed

ds_config.json:

Script de entrenamiento

Configuración de ZeRO Etapa 2

Configuración de ZeRO Etapa 3

Para modelos grandes:

Con Hugging Face Transformers

Integración con Trainer

Entrenamiento multi-GPU

Comando de inicio

Con torchrun

Entrenamiento multinodo

Archivo de hosts

hostfile:

Iniciar

Configuración SSH

Configuraciones eficientes en memoria

Modelo de 7B en GPU de 24 GB

Modelo de 13B en GPU de 24 GB

Punto de control de gradiente

Ahorra memoria recomputando activaciones:

Guardar y cargar puntos de control

Guardar

Cargar

Guardar en formato Hugging Face

Monitoreo

TensorBoard

Weights & Biases

Problemas comunes

Sin memoria

Entrenamiento lento

  • Reduce la descarga a CPU

  • Aumenta el tamaño del lote

  • Usa ZeRO Etapa 2 en lugar de 3

Errores de NCCL

Consejos de rendimiento

Consejo
Efecto

Usa bf16 en lugar de fp16

Mejor estabilidad

Activa el checkpointing de gradiente

Menos memoria

Ajusta el tamaño del lote

Mejor rendimiento

Usa descarga a NVMe

Modelos más grandes

Comparación de rendimiento

Modelo
GPUs
Etapa de ZeRO
Velocidad de entrenamiento

7B

1x A100

ZeRO-3

~1000 tokens/s

7B

4x A100

ZeRO-2

~4000 tokens/s

13B

4x A100

ZeRO-3

~2000 tokens/s

70B

8x A100

ZeRO-3

~800 tokens/s

Solución de problemas

Estimación de costos

Tarifas típicas del marketplace de CLORE.AI (a partir de 2024):

GPU
Tarifa por hora
Tarifa diaria
Sesión de 4 horas

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

Los precios varían según el proveedor y la demanda. Consulta Marketplace de CLORE.AI las tarifas actuales.

Ahorra dinero:

  • Usa el Spot mercado para trabajo interrumpible — alrededor de un tercio de los servidores fija el precio spot por debajo del precio bajo demanda (mediana de ~13% de descuento), el resto lo iguala

  • Paga con CLORE tokens

  • Compara precios entre distintos proveedores

Siguientes pasos

Última actualización

¿Te fue útil?