For the complete documentation index, see llms.txt. This page is also available as Markdown.

LLaMA-Factory

Ajusta finamente más de 100 LLMs con LoRA/QLoRA y una interfaz web en GPUs de Clore.ai usando LLaMA-Factory

LLaMA-Factory es el marco de ajuste fino de código abierto más completo, compatible con más de 100 modelos de lenguaje, incluidas todas las variantes de LLaMA, Qwen, Mistral, Phi, Falcon, ChatGLM y más. Ofrece LoRA, QLoRA, ajuste fino completo, RLHF, DPO y PPO, todo a través de una interfaz web intuitiva (LLaMA Board) o CLI. Los servidores GPU bajo demanda de CLORE.AI lo convierten en la plataforma perfecta para lanzar trabajos de ajuste fino a una fracción del costo de los proveedores de nube.

Requisitos del servidor

Parámetro
Mínimo
Recomendado

RAM

16 GB

32 GB+

VRAM

8 GB (QLoRA)

24 GB+

Disco

50 GB

200 GB+

GPU

NVIDIA RTX 2080+

A100, RTX 4090

El método de entrenamiento determina los requisitos de GPU:

  • QLoRA (4 bits): 8 GB de VRAM para modelos de 7B, 16 GB para 13B

  • LoRA (float16): 16 GB de VRAM para modelos de 7B, 40 GB para 13B

  • Ajuste fino completo: ~14 GB de VRAM por cada parámetro de 7B (+ estados del optimizador)

  • Multi-GPU (DeepSpeed/FSDP) escala a cualquier número de GPUs

Despliegue rápido en CLORE.AI

Imagen de Docker: hiyouga/llamafactory:latest

Puertos: 22/tcp, 7860/http

Variables de entorno:

Variable
Ejemplo
Descripción

HF_TOKEN

hf_xxx...

Token de HuggingFace para modelos restringidos

WANDB_API_KEY

xxx...

Weights & Biases para el seguimiento de experimentos

CUDA_VISIBLE_DEVICES

0,1

GPUs a usar

Configuración paso a paso

1. Alquila un servidor GPU en CLORE.AI

Visita Marketplace de CLORE.AI y selecciona según tu tarea:

Tarea
VRAM
GPU recomendada

QLoRA 7B

8 GB

RTX 3070/2080

QLoRA 13B

16 GB

RTX 3090/A4000

LoRA 7B

16 GB

RTX 3090/A4000

LoRA 13B

40 GB

A6000/A100 40GB

FT completo 7B

80 GB

A100 80GB

Multi-GPU

Varía

2-8× cualquier GPU

2. Conéctate por SSH a tu servidor

3. Crear directorios de trabajo

4. Descargar la imagen de Docker

5. Iniciar LLaMA-Factory

Iniciar con la interfaz web (LLaMA Board):

Con seguimiento de Weights & Biases:

Multi-GPU con DeepSpeed (4 GPUs):

6. Accede a la interfaz web

Revisa los registros y obtén la URL:

Tu URL http_pub de CLORE.AI para el puerto 7860:


Ejemplos de uso

Ejemplo 1: Ajuste fino LoRA mediante la interfaz web (LLaMA Board)

  1. Abre LLaMA Board en tu URL de CLORE.AI

  2. Ve a la Entrenar pestaña

  3. Configura:

    • Nombre del modelo: LLaMA-3Meta-Llama-3-8B-Instruct

    • Etapa de entrenamiento: Ajuste fino supervisado

    • Conjunto de datos: selecciona tu conjunto de datos (o sube uno personalizado)

    • Método de ajuste fino: lora

    • Rango de LoRA: 8 (más alto = más parámetros entrenados)

    • Tasa de aprendizaje: 1e-4

    • Épocas: 3

    • Directorio de salida: llama3-finetuned

  4. Haz clic en Iniciar para comenzar el entrenamiento

  5. Monitorea las curvas de pérdida en el Pérdida gráfico

Ejemplo 2: Ajuste fino QLoRA basado en CLI

Prepara un YAML de configuración de entrenamiento:

Ejemplo 3: Subir un conjunto de datos personalizado

Crea un conjunto de datos personalizado en formato Alpaca:

Luego selecciona my_dataset en el menú desplegable de conjuntos de datos de LLaMA Board.

Ejemplo 4: DPO (Optimización Directa de Preferencias)

Ejemplo 5: Inferencia con modelo ajustado

Después del entrenamiento, prueba tu modelo:

O exporta el modelo combinado:


Configuración

Parámetros clave de entrenamiento

Parámetro
Valor típico
Descripción

lora_rank

8–64

Rango de LoRA (más alto = más expresivo)

lora_alpha

2× rango

Escalado alfa de LoRA

lora_dropout

0.0–0.1

Dropout para las capas LoRA

lora_target

all

Qué capas aplicar con LoRA

learning_rate

1e-4

Tasa de aprendizaje inicial

num_train_epochs

1–5

Épocas de entrenamiento

per_device_train_batch_size

1–4

Tamaño de lote por GPU

gradient_accumulation_steps

4–16

Multiplicador efectivo del lote

cutoff_len

1024–4096

Longitud máxima de secuencia

quantization_bit

4 u 8

Bits de cuantización de QLoRA

warmup_ratio

0.05–0.1

Fracción de calentamiento de LR

lr_scheduler_type

cosine

Planificación de LR

Métodos de ajuste fino compatibles

Método
Uso de memoria
Calidad
Cuándo usar

full

Muy alta

Mejor

VRAM ilimitada

freeze

Medio

Bueno

Congelar capas base

lora

Baja

Muy bueno

Opción predeterminada

qlora (lora+quant)

Más bajo

Bueno

VRAM limitada

Entrenamiento DeepSpeed multi-GPU

Para entrenar en múltiples GPUs, inicia con torchrun:


Consejos de rendimiento

1. Configuración óptima de QLoRA por GPU

8 GB de VRAM (RTX 3070):

24 GB de VRAM (RTX 3090/4090):

80 GB de VRAM (A100):

2. Flash Attention 2 para contextos más largos

Esto permite entrenar con secuencias 2× más largas en la misma VRAM.

3. Checkpointing de gradiente

Ahorra VRAM a costa de un entrenamiento ~20% más lento:

4. Elige el objetivo de LoRA correcto

5. Congela las capas superiores para una adaptación rápida

Mucho más rápido que LoRA completo para una adaptación simple de tareas.

6. Monitorea con TensorBoard

Añade el puerto 6006 a tu pedido de CLORE.AI para acceder a TensorBoard.


Solución de problemas

Problema: "CUDA out of memory" durante el entrenamiento

  1. Reduce el tamaño del lote: per_device_train_batch_size: 1

  2. Activa el checkpointing de gradiente: gradient_checkpointing: true

  3. Reduce la longitud del contexto: cutoff_len: 512

  4. Usa QLoRA (4 bits): quantization_bit: 4

  5. Reduce el rango de LoRA: lora_rank: 4

Problema: La pérdida de entrenamiento no disminuye

  • Comprueba la tasa de aprendizaje — prueba 5e-5 o 2e-4

  • Verifica que el formato del conjunto de datos coincida con la plantilla

  • Aumenta lora_rank (8→16→32)

  • Comprueba que lora_target: all está configurado

Problema: Velocidad de entrenamiento lenta

Si la GPU está utilizada en menos del 80%:

  • Aumenta el tamaño del lote

  • Usa Flash Attention: flash_attn: fa2

  • Elimina gradient_checkpointing si la VRAM lo permite

Problema: El modelo no se encuentra en la interfaz web

Luego actualiza la lista de modelos en LLaMA Board.

Problema: Errores de formato del conjunto de datos

Todos los formatos de conjunto de datos deben coincidir con dataset_info.json la especificación:

Problema: El puerto de WebUI no es accesible

Asegúrate de que LLaMA-Factory inició el servidor Gradio:

Añade --share como alternativa, usa la bandera para una URL pública de Gradio.


Enlaces


Recomendaciones de GPU para Clore.ai

Caso de uso
GPU recomendada
Costo estimado en Clore.ai

Desarrollo/Pruebas

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Ajuste fino (7B–13B)

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

Modelos grandes (70B+)

A100 80GB

Entrenamiento multi-GPU

2-4x A100 80GB

💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.

Última actualización

¿Te fue útil?