Fusión de modelos con Mergekit
Mergekit es el conjunto de herramientas definitivo para fusionar modelos de lenguaje grandes preentrenados. Con más de 5K estrellas en GitHub, implementa todos los principales algoritmos de fusión de modelos — SLERP, TIES, DARE, DARE-TIES, fusión MoE y más —, lo que te permite crear nuevos y potentes modelos sin ningún dato de entrenamiento ni tiempo de entrenamiento en GPU.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
¿Qué es Mergekit?
La fusión de modelos es una técnica potente que combina las fortalezas de múltiples LLM en un solo modelo:
No requiere entrenamiento — la fusión ocurre en el espacio de pesos, no mediante backprop
Combinar capacidades — combinar un modelo de programación con un modelo que sigue instrucciones
Reducir debilidades — promediar los fallos individuales de los modelos en un conjunto
Crear una mezcla de expertos — combinar modelos en una arquitectura MoE dispersa
Adaptación al dominio — fusionar un modelo base con modelos especializados en un dominio
Mergekit implementa todos los algoritmos de última generación:
SLERP
Interpolación lineal esférica entre dos modelos
Mezcla suave de dos modelos similares
TIES
Recortar parámetros redundantes, elegir signos, fusionar
Combinar múltiples modelos con una interferencia mínima
DARE
Eliminar y reescalar parámetros aleatorios
Reducir la interferencia de parámetros en grandes fusiones
DARE-TIES
DARE + TIES combinados
La mejor opción general para fusiones de múltiples modelos
Lineal
Promedio ponderado simple
Fusiones rápidas de referencia
Aritmética de tareas
Sumar/restar vectores de tareas
Añadir/eliminar capacidades específicas
Paso directo
Copiar capas directamente
Construcción de MoE
Requisitos del servidor
GPU
No es necesario (la fusión en CPU es posible)
A100 de 40 GB para modelos grandes
VRAM
—
80 GB para fusiones de modelos de 70B
RAM
32 GB
64 GB+ (los modelos se cargan en la RAM)
CPU
8 núcleos
16+ núcleos
Almacenamiento
100 GB
500 GB+
SO
Ubuntu 20.04+
Ubuntu 22.04
Python
3.10+
3.11
Para la fusión solo en CPU (el modo más común), la RAM es tu cuello de botella. Fusionar dos modelos de 7B en bf16 requiere ~28 GB de RAM como mínimo. Usa --lazy-unpickle para un menor uso de memoria.
Puertos
22
SSH
Acceso al terminal y transferencia de archivos
Mergekit se ejecuta como una herramienta de línea de comandos: no se necesita servidor web.
Instalación en Clore.ai
Paso 1 — Alquilar un servidor
Filtra por RAM ≥ 64 GB (crítico para fusiones de modelos grandes)
Elige Almacenamiento ≥ 500 GB (los modelos fusionados necesitan espacio para 2-4 modelos de entrada + la salida)
La GPU es opcional, pero útil si quieres probar el modelo fusionado después
Abrir puerto 22 solo
Paso 2 — Conectarse por SSH
Paso 3 — Instalar el entorno de Python
Paso 4 — Instalar Mergekit
Paso 5 — Instalar la CLI de HuggingFace
Paso 6 — Verificar la instalación
Descargando modelos para fusionar
Configuraciones de fusión
Mergekit utiliza archivos de configuración YAML para definir fusiones.
Ejemplo 1: Fusión SLERP (dos modelos)
SLERP mezcla dos modelos a lo largo de un arco esférico — mejor para modelos de la misma arquitectura:
Ejemplo 2: Fusión TIES (múltiples modelos)
TIES maneja la interferencia entre múltiples modelos fusionados:
Ejemplo 3: Fusión DARE-TIES (la mejor opción general)
Ejemplo 4: Aritmética de tareas (añadir capacidades)
Añade un "delta de habilidad" a un modelo base:
Ejemplo 5: MoE (mezcla de expertos)
Combina modelos en una arquitectura MoE dispersa:
Ejecutando la fusión
Comando básico
Supervisar el progreso
Probando el modelo fusionado
Publicando en HuggingFace
Avanzado: fusión evolutiva
Usa el optimizador evolutivo de Mergekit para encontrar los pesos óptimos de fusión:
Solución de problemas
Memoria insuficiente (OOM) durante la fusión
ValueError: los modelos no son compatibles
La fusión es muy lenta
El modelo fusionado produce galimatías
FileNotFoundError de archivos del modelo
Recetas populares de fusión
Asistente general + programación
Refuerzo multilingüe
Enlaces útiles
GitHub: https://github.com/arcee-ai/mergekit ⭐ 5K+
Documentación: https://github.com/arcee-ai/mergekit/wiki
Modelos MergeKit en HuggingFace: https://huggingface.co/models?other=mergekit
Discord de Arcee.ai: https://discord.gg/arcee
Paper de TIES: https://arxiv.org/abs/2306.01708
Paper de DARE: https://arxiv.org/abs/2311.03099
Marketplace de Clore.ai: https://clore.ai/marketplace
Recomendaciones de GPU para Clore.ai
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Desarrollo/Pruebas
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Fusión de modelos (7B–13B)
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.
Última actualización
¿Te fue útil?