LLaMA-Factory
Ajusta finamente más de 100 LLMs con LoRA/QLoRA y una interfaz web en GPUs de Clore.ai usando LLaMA-Factory
LLaMA-Factory es el marco de ajuste fino de código abierto más completo, compatible con más de 100 modelos de lenguaje, incluidas todas las variantes de LLaMA, Qwen, Mistral, Phi, Falcon, ChatGLM y más. Ofrece LoRA, QLoRA, ajuste fino completo, RLHF, DPO y PPO, todo a través de una interfaz web intuitiva (LLaMA Board) o CLI. Los servidores GPU bajo demanda de CLORE.AI lo convierten en la plataforma perfecta para lanzar trabajos de ajuste fino a una fracción del costo de los proveedores de nube.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Requisitos del servidor
RAM
16 GB
32 GB+
VRAM
8 GB (QLoRA)
24 GB+
Disco
50 GB
200 GB+
GPU
NVIDIA RTX 2080+
A100, RTX 4090
Despliegue rápido en CLORE.AI
Imagen de Docker: hiyouga/llamafactory:latest
Puertos: 22/tcp, 7860/http
Variables de entorno:
HF_TOKEN
hf_xxx...
Token de HuggingFace para modelos restringidos
WANDB_API_KEY
xxx...
Weights & Biases para el seguimiento de experimentos
CUDA_VISIBLE_DEVICES
0,1
GPUs a usar
Configuración paso a paso
1. Alquila un servidor GPU en CLORE.AI
Visita Marketplace de CLORE.AI y selecciona según tu tarea:
QLoRA 7B
8 GB
RTX 3070/2080
QLoRA 13B
16 GB
RTX 3090/A4000
LoRA 7B
16 GB
RTX 3090/A4000
LoRA 13B
40 GB
A6000/A100 40GB
FT completo 7B
80 GB
A100 80GB
Multi-GPU
Varía
2-8× cualquier GPU
2. Conéctate por SSH a tu servidor
3. Crear directorios de trabajo
4. Descargar la imagen de Docker
5. Iniciar LLaMA-Factory
Iniciar con la interfaz web (LLaMA Board):
Con seguimiento de Weights & Biases:
Multi-GPU con DeepSpeed (4 GPUs):
6. Accede a la interfaz web
Revisa los registros y obtén la URL:
Tu URL http_pub de CLORE.AI para el puerto 7860:
Ejemplos de uso
Ejemplo 1: Ajuste fino LoRA mediante la interfaz web (LLaMA Board)
Abre LLaMA Board en tu URL de CLORE.AI
Ve a la Entrenar pestaña
Configura:
Nombre del modelo:
LLaMA-3→Meta-Llama-3-8B-InstructEtapa de entrenamiento:
Ajuste fino supervisadoConjunto de datos: selecciona tu conjunto de datos (o sube uno personalizado)
Método de ajuste fino:
loraRango de LoRA:
8(más alto = más parámetros entrenados)Tasa de aprendizaje:
1e-4Épocas:
3Directorio de salida:
llama3-finetuned
Haz clic en Iniciar para comenzar el entrenamiento
Monitorea las curvas de pérdida en el Pérdida gráfico
Ejemplo 2: Ajuste fino QLoRA basado en CLI
Prepara un YAML de configuración de entrenamiento:
Ejemplo 3: Subir un conjunto de datos personalizado
Crea un conjunto de datos personalizado en formato Alpaca:
Luego selecciona my_dataset en el menú desplegable de conjuntos de datos de LLaMA Board.
Ejemplo 4: DPO (Optimización Directa de Preferencias)
Ejemplo 5: Inferencia con modelo ajustado
Después del entrenamiento, prueba tu modelo:
O exporta el modelo combinado:
Configuración
Parámetros clave de entrenamiento
lora_rank
8–64
Rango de LoRA (más alto = más expresivo)
lora_alpha
2× rango
Escalado alfa de LoRA
lora_dropout
0.0–0.1
Dropout para las capas LoRA
lora_target
all
Qué capas aplicar con LoRA
learning_rate
1e-4
Tasa de aprendizaje inicial
num_train_epochs
1–5
Épocas de entrenamiento
per_device_train_batch_size
1–4
Tamaño de lote por GPU
gradient_accumulation_steps
4–16
Multiplicador efectivo del lote
cutoff_len
1024–4096
Longitud máxima de secuencia
quantization_bit
4 u 8
Bits de cuantización de QLoRA
warmup_ratio
0.05–0.1
Fracción de calentamiento de LR
lr_scheduler_type
cosine
Planificación de LR
Métodos de ajuste fino compatibles
full
Muy alta
Mejor
VRAM ilimitada
freeze
Medio
Bueno
Congelar capas base
lora
Baja
Muy bueno
Opción predeterminada
qlora (lora+quant)
Más bajo
Bueno
VRAM limitada
Entrenamiento DeepSpeed multi-GPU
Para entrenar en múltiples GPUs, inicia con torchrun:
Consejos de rendimiento
1. Configuración óptima de QLoRA por GPU
8 GB de VRAM (RTX 3070):
24 GB de VRAM (RTX 3090/4090):
80 GB de VRAM (A100):
2. Flash Attention 2 para contextos más largos
Esto permite entrenar con secuencias 2× más largas en la misma VRAM.
3. Checkpointing de gradiente
Ahorra VRAM a costa de un entrenamiento ~20% más lento:
4. Elige el objetivo de LoRA correcto
5. Congela las capas superiores para una adaptación rápida
Mucho más rápido que LoRA completo para una adaptación simple de tareas.
6. Monitorea con TensorBoard
Añade el puerto 6006 a tu pedido de CLORE.AI para acceder a TensorBoard.
Solución de problemas
Problema: "CUDA out of memory" durante el entrenamiento
Reduce el tamaño del lote:
per_device_train_batch_size: 1Activa el checkpointing de gradiente:
gradient_checkpointing: trueReduce la longitud del contexto:
cutoff_len: 512Usa QLoRA (4 bits):
quantization_bit: 4Reduce el rango de LoRA:
lora_rank: 4
Problema: La pérdida de entrenamiento no disminuye
Comprueba la tasa de aprendizaje — prueba
5e-5o2e-4Verifica que el formato del conjunto de datos coincida con la plantilla
Aumenta
lora_rank(8→16→32)Comprueba que
lora_target: allestá configurado
Problema: Velocidad de entrenamiento lenta
Si la GPU está utilizada en menos del 80%:
Aumenta el tamaño del lote
Usa Flash Attention:
flash_attn: fa2Elimina
gradient_checkpointingsi la VRAM lo permite
Problema: El modelo no se encuentra en la interfaz web
Luego actualiza la lista de modelos en LLaMA Board.
Problema: Errores de formato del conjunto de datos
Todos los formatos de conjunto de datos deben coincidir con dataset_info.json la especificación:
Problema: El puerto de WebUI no es accesible
Asegúrate de que LLaMA-Factory inició el servidor Gradio:
Añade --share como alternativa, usa la bandera para una URL pública de Gradio.
Enlaces
Recomendaciones de GPU para Clore.ai
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Desarrollo/Pruebas
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Ajuste fino (7B–13B)
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.
Última actualización
¿Te fue útil?