For the complete documentation index, see llms.txt. This page is also available as Markdown.

Fine-tuning 2x más rápido con Unsloth

Ajusta LLMs 2x más rápido con un 70% menos de VRAM usando Unsloth en Clore.ai

Unsloth reescribe las partes críticas para el rendimiento de HuggingFace Transformers con kernels Triton optimizados a mano, entregando 2x velocidad de entrenamiento y reducción del 70% de VRAM sin pérdida de precisión. Es un reemplazo directo — tus scripts TRL/PEFT existentes funcionan sin cambios después de cambiar la importación.

Características clave

  • entrenamiento 2x más rápido — kernels Triton personalizados para atención, RoPE, cross-entropy y normalización RMS

  • 70% menos VRAM — checkpointing de gradiente inteligente y pesos mapeados en memoria

  • Reemplazo directo de HuggingFace — un cambio de importación, nada más

  • QLoRA / LoRA / ajuste fino completo — todos los modos compatibles desde el primer momento

  • Exportación nativa — guardar directamente en GGUF (todos los tipos de cuantización), adaptadores LoRA o modelo fusionado de 16 bits

  • Amplia cobertura de modelos — Llama 3.x, Mistral, Qwen 2.5, Gemma 2, DeepSeek-R1, Phi-4 y más

  • Gratis y de código abierto (Apache 2.0)

Requisitos

Componente
Mínimo
Recomendado

GPU

RTX 3060 12 GB

RTX 4090 24 GB

VRAM

10 GB

24 GB

RAM

16 GB

32 GB

Disco

40 GB

80 GB

CUDA

12.8+

12.8+

Python

3.10

3.11

Precios de Clore.ai: RTX 4090 ≈ $0.14–0.42/h · RTX 3090 ≈ $0.07–0.21/h · RTX 3060 ≈ $0.03–0.07/h

Un modelo de 7B con QLoRA de 4 bits cabe en ~10 GB de VRAM, lo que hace viable incluso una RTX 3060.

Inicio rápido

1. Instala Unsloth

2. Carga un modelo con cuantización de 4 bits

3. Aplica adaptadores LoRA

4. Prepara los datos y entrena

Exportando el modelo

Guardar solo el adaptador LoRA

Fusionar y guardar el modelo completo (float16)

Exportar a GGUF para Ollama / llama.cpp

Después de exportar, sirva con Ollama:

Ejemplos de uso

Ajuste fino en un conjunto de datos de chat personalizado

Entrenamiento de alineación DPO / ORPO

Referencia de uso de VRAM

Modelo
Cuantización
Método
VRAM
GPU

Llama 3.1 8B

4 bits

QLoRA

~10 GB

RTX 3060

Llama 3.1 8B

16 bits

LoRA

~18 GB

RTX 3090

Qwen 2.5 14B

4 bits

QLoRA

~14 GB

RTX 3090

Mistral 7B

4 bits

QLoRA

~9 GB

RTX 3060

DeepSeek-R1 7B

4 bits

QLoRA

~10 GB

RTX 3060

Llama 3.3 70B

4 bits

QLoRA

~44 GB

2× RTX 3090

Consejos

  • Usa siempre use_gradient_checkpointing="unsloth" — este es el mayor ahorrador de VRAM, exclusivo de Unsloth

  • Establece lora_dropout=0 — los kernels Triton de Unsloth están optimizados para cero dropout y funcionan más rápido

  • Usa packing=True en SFTTrainer para evitar desperdicio de padding en ejemplos cortos

  • Empieza con r=16 para el rango de LoRA — aumenta a 32 o 64 solo si la pérdida de validación se estanca

  • Monitorea con wandb — añade report_to="wandb" en TrainingArguments para seguimiento de la pérdida

  • Ajuste del tamaño de lote — aumenta per_device_train_batch_size hasta acercarte al límite de VRAM, luego compénsalo con gradient_accumulation_steps

Solución de problemas

Problema
Solución

OutOfMemoryError durante el entrenamiento

Reduce el tamaño de lote a 1, disminuye max_seq_length, o usa cuantización de 4 bits

Errores de compilación del kernel Triton

Ejecuta pip install triton --upgrade y asegúrate de que el toolkit CUDA coincida

Primer paso lento (compilando)

Normal — Triton compila kernels en la primera ejecución, luego quedan en caché

bitsandbytes Error de versión de CUDA

Instala la versión compatible: pip install bitsandbytes --upgrade

Picos de pérdida durante el entrenamiento

Reduce la tasa de aprendizaje a 1e-4, añade pasos de calentamiento

La exportación GGUF falla

Asegúrate de tener suficiente RAM (2× el tamaño del modelo) y espacio en disco para la conversión

Recursos

Última actualización

¿Te fue útil?