For the complete documentation index, see llms.txt. This page is also available as Markdown.

Ajustar finamente LLM

Ajusta finamente LLMs personalizados con técnicas eficientes en las GPU de Clore.ai

Entrena tu propio LLM personalizado usando técnicas eficientes de fine-tuning en GPUs de CLORE.AI.

Alquilar en CLORE.AI

  1. Filtra por tipo de GPU, VRAM y precio

  2. Elige Bajo demanda (tarifa fija) o Spot (precio de oferta)

  3. Configura tu pedido:

    • Selecciona la imagen Docker

    • Configura los puertos (TCP para SSH, HTTP para interfaces web)

    • Añade variables de entorno si es necesario

    • Introduce el comando de inicio

  4. Selecciona el pago: CLORE, BTC, o USDT/USDC

  5. Crea el pedido y espera el despliegue

Accede a tu servidor

  • Encuentra los detalles de conexión en Mis pedidos

  • Interfaces web: usa la URL del puerto HTTP

  • SSH: ssh -p <port> root@<proxy-address>

¿Qué es LoRA/QLoRA?

  • LoRA (Adaptación de bajo rango) - Entrena pequeñas capas adaptadoras en lugar del modelo completo

  • QLoRA - LoRA con cuantización para usar aún menos VRAM

  • Entrena un modelo 7B en una sola RTX 3090

  • Entrena un modelo 70B en una sola A100

Requisitos

Modelo
Método
VRAM mínima
Recomendado

7B

QLoRA

12GB

13B

QLoRA

20GB

70B

QLoRA

48GB

A100 80GB

7B

LoRA completo

24GB

RTX 4090

Despliegue rápido

Imagen Docker:

Puertos:

Comando:

Accediendo a tu servicio

Después del despliegue, encuentra tu http_pub URL en Mis pedidos:

  1. Ve a la Mis pedidos página

  2. Haz clic en tu pedido

  3. Encuentra la http_pub URL (por ejemplo, abc123.clorecloud.net)

Usa https://YOUR_HTTP_PUB_URL en lugar de localhost en los ejemplos de abajo.

Preparación del conjunto de datos

Formato de chat (recomendado)

Formato de instrucciones

Formato Alpaca

Modelos modernos compatibles (2025)

Modelo
ID de HF
VRAM mínima (QLoRA)

Llama 3.1 / 3.3 8B

meta-llama/Llama-3.1-8B-Instruct

12GB

Qwen 2.5 7B / 14B

Qwen/Qwen2.5-7B-Instruct

12GB / 20GB

DeepSeek-R1-Distill (7B/8B)

deepseek-ai/DeepSeek-R1-Distill-Qwen-7B

12GB

Mistral 7B v0.3

mistralai/Mistral-7B-Instruct-v0.3

12GB

Gemma 2 9B

google/gemma-2-9b-it

14GB

Phi-4 14B

microsoft/phi-4

20GB

Script de fine-tuning QLoRA

Ejemplo moderno con PEFT 0.14+, Flash Attention 2, soporte DoRA y compatibilidad con Qwen2.5 / DeepSeek-R1:

Flash Attention 2

Flash Attention 2 reduce el uso de VRAM y acelera significativamente el entrenamiento. Requiere GPU Ampere+ (RTX 3090, RTX 4090, A100).

Configuración
VRAM (7B)
Velocidad

Atención estándar (fp16)

~22GB

línea base

Flash Attention 2 (bf16)

~16GB

+30%

Flash Attention 2 + QLoRA

~12GB

+30%

DoRA (LoRA descompuesto por pesos)

DoRA (PEFT >= 0.14) descompone los pesos preentrenados en componentes de magnitud y dirección. Mejora la calidad del fine-tuning, especialmente para rangos más pequeños.

Ejemplos de Qwen2.5 y DeepSeek-R1-Distill

Fine-tuning de Qwen2.5

Fine-tuning de DeepSeek-R1-Distill

Los modelos DeepSeek-R1-Distill (Qwen-7B, Qwen-14B, Llama-8B, Llama-70B) están centrados en el razonamiento. Ajusta el fine-tuning para adaptar su estilo de cadena de pensamiento a tu dominio.

Usando Axolotl (más fácil)

Axolotl simplifica el fine-tuning con configuraciones YAML:

Ejemplos de configuración de Axolotl

Modelo de chat

Modelo de código

Fusionando pesos LoRA

Después del entrenamiento, fusiona LoRA de nuevo en el modelo base:

Convertir a GGUF

Para usar con llama.cpp/Ollama:

Monitorización del entrenamiento

Weights & Biases

TensorBoard

Mejores prácticas

Hiperparámetros

Parámetro
Modelo 7B
Modelo 13B
Modelo 70B

tamaño_de_lote

4

2

1

grad_accum

4

8

16

lr

2e-4

1e-4

5e-5

lora_r

64

32

16

epochs

3

2-3

1-2

Tamaño del conjunto de datos

  • Mínimo: 1.000 ejemplos

  • Bueno: 10.000+ ejemplos

  • La calidad > la cantidad

Evitar el sobreajuste

Entrenamiento multi-GPU

Configuración de DeepSpeed:

Guardado y exportación

Solución de problemas

Errores OOM

  • Reduce el tamaño del lote

  • Aumenta la acumulación de gradiente

  • Usa gradient_checkpointing=True

  • Reduce lora_r

La pérdida de entrenamiento no disminuye

  • Verificar el formato de los datos

  • Aumentar la tasa de aprendizaje

  • Comprobar problemas con los datos

Pérdida NaN

  • Reducir la tasa de aprendizaje

  • Usar fp32 en lugar de fp16

  • Comprobar si hay datos corruptos

Estimación de costos

Tarifas típicas del mercado de CLORE.AI (a fecha de 2026):

GPU
Tarifa por hora
Tarifa diaria
Sesión de 4 horas

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40 GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

Los precios varían según el proveedor y la demanda. Consulta CLORE.AI Marketplace las tarifas actuales.

📚 Ver también: Cómo ajustar finamente LLaMA 3 en una GPU en la nube — Guía paso a paso

Ahorra dinero:

  • Usa Spot mercado para cargas de trabajo flexibles (a menudo entre un 30 % y un 50 % más barato)

  • Paga con CLORE tokens

  • Compara precios entre diferentes proveedores

Última actualización

¿Te fue útil?