Fine-tuning 2x más rápido con Unsloth
Ajusta LLMs 2x más rápido con un 70% menos de VRAM usando Unsloth en Clore.ai
Unsloth reescribe las partes críticas para el rendimiento de HuggingFace Transformers con kernels Triton optimizados a mano, entregando 2x velocidad de entrenamiento y reducción del 70% de VRAM sin pérdida de precisión. Es un reemplazo directo — tus scripts TRL/PEFT existentes funcionan sin cambios después de cambiar la importación.
Todos los ejemplos se ejecutan en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Características clave
entrenamiento 2x más rápido — kernels Triton personalizados para atención, RoPE, cross-entropy y normalización RMS
70% menos VRAM — checkpointing de gradiente inteligente y pesos mapeados en memoria
Reemplazo directo de HuggingFace — un cambio de importación, nada más
QLoRA / LoRA / ajuste fino completo — todos los modos compatibles desde el primer momento
Exportación nativa — guardar directamente en GGUF (todos los tipos de cuantización), adaptadores LoRA o modelo fusionado de 16 bits
Amplia cobertura de modelos — Llama 3.x, Mistral, Qwen 2.5, Gemma 2, DeepSeek-R1, Phi-4 y más
Gratis y de código abierto (Apache 2.0)
Requisitos
GPU
RTX 3060 12 GB
RTX 4090 24 GB
VRAM
10 GB
24 GB
RAM
16 GB
32 GB
Disco
40 GB
80 GB
CUDA
12.8+
12.8+
Python
3.10
3.11
Precios de Clore.ai: RTX 4090 ≈ $0.14–0.42/h · RTX 3090 ≈ $0.07–0.21/h · RTX 3060 ≈ $0.03–0.07/h
Un modelo de 7B con QLoRA de 4 bits cabe en ~10 GB de VRAM, lo que hace viable incluso una RTX 3060.
Inicio rápido
1. Instala Unsloth
2. Carga un modelo con cuantización de 4 bits
3. Aplica adaptadores LoRA
4. Prepara los datos y entrena
Exportando el modelo
Guardar solo el adaptador LoRA
Fusionar y guardar el modelo completo (float16)
Exportar a GGUF para Ollama / llama.cpp
Después de exportar, sirva con Ollama:
Ejemplos de uso
Ajuste fino en un conjunto de datos de chat personalizado
Entrenamiento de alineación DPO / ORPO
Referencia de uso de VRAM
Llama 3.1 8B
4 bits
QLoRA
~10 GB
RTX 3060
Llama 3.1 8B
16 bits
LoRA
~18 GB
RTX 3090
Qwen 2.5 14B
4 bits
QLoRA
~14 GB
RTX 3090
Mistral 7B
4 bits
QLoRA
~9 GB
RTX 3060
DeepSeek-R1 7B
4 bits
QLoRA
~10 GB
RTX 3060
Llama 3.3 70B
4 bits
QLoRA
~44 GB
2× RTX 3090
Consejos
Usa siempre
use_gradient_checkpointing="unsloth"— este es el mayor ahorrador de VRAM, exclusivo de UnslothEstablece
lora_dropout=0— los kernels Triton de Unsloth están optimizados para cero dropout y funcionan más rápidoUsa
packing=Trueen SFTTrainer para evitar desperdicio de padding en ejemplos cortosEmpieza con
r=16para el rango de LoRA — aumenta a 32 o 64 solo si la pérdida de validación se estancaMonitorea con wandb — añade
report_to="wandb"en TrainingArguments para seguimiento de la pérdidaAjuste del tamaño de lote — aumenta
per_device_train_batch_sizehasta acercarte al límite de VRAM, luego compénsalo congradient_accumulation_steps
Solución de problemas
OutOfMemoryError durante el entrenamiento
Reduce el tamaño de lote a 1, disminuye max_seq_length, o usa cuantización de 4 bits
Errores de compilación del kernel Triton
Ejecuta pip install triton --upgrade y asegúrate de que el toolkit CUDA coincida
Primer paso lento (compilando)
Normal — Triton compila kernels en la primera ejecución, luego quedan en caché
bitsandbytes Error de versión de CUDA
Instala la versión compatible: pip install bitsandbytes --upgrade
Picos de pérdida durante el entrenamiento
Reduce la tasa de aprendizaje a 1e-4, añade pasos de calentamiento
La exportación GGUF falla
Asegúrate de tener suficiente RAM (2× el tamaño del modelo) y espacio en disco para la conversión
Recursos
Última actualización
¿Te fue útil?