For the complete documentation index, see llms.txt. This page is also available as Markdown.

Fusión de modelos con Mergekit

Mergekit es el conjunto de herramientas definitivo para fusionar modelos de lenguaje grandes preentrenados. Con más de 5K estrellas en GitHub, implementa todos los principales algoritmos de fusión de modelos — SLERP, TIES, DARE, DARE-TIES, fusión MoE y más —, lo que te permite crear nuevos y potentes modelos sin ningún dato de entrenamiento ni tiempo de entrenamiento en GPU.


¿Qué es Mergekit?

La fusión de modelos es una técnica potente que combina las fortalezas de múltiples LLM en un solo modelo:

  • No requiere entrenamiento — la fusión ocurre en el espacio de pesos, no mediante backprop

  • Combinar capacidades — combinar un modelo de programación con un modelo que sigue instrucciones

  • Reducir debilidades — promediar los fallos individuales de los modelos en un conjunto

  • Crear una mezcla de expertos — combinar modelos en una arquitectura MoE dispersa

  • Adaptación al dominio — fusionar un modelo base con modelos especializados en un dominio

Mergekit implementa todos los algoritmos de última generación:

Algoritmo
Descripción
Ideal para

SLERP

Interpolación lineal esférica entre dos modelos

Mezcla suave de dos modelos similares

TIES

Recortar parámetros redundantes, elegir signos, fusionar

Combinar múltiples modelos con una interferencia mínima

DARE

Eliminar y reescalar parámetros aleatorios

Reducir la interferencia de parámetros en grandes fusiones

DARE-TIES

DARE + TIES combinados

La mejor opción general para fusiones de múltiples modelos

Lineal

Promedio ponderado simple

Fusiones rápidas de referencia

Aritmética de tareas

Sumar/restar vectores de tareas

Añadir/eliminar capacidades específicas

Paso directo

Copiar capas directamente

Construcción de MoE

La fusión de modelos es sorprendentemente eficaz. Los modelos fusionados a menudo superan a sus modelos de origen en los benchmarks al combinar conocimientos complementarios. La comunidad de MergeKit en HuggingFace aloja miles de modelos fusionados.


Requisitos del servidor

Componente
Mínimo
Recomendado

GPU

No es necesario (la fusión en CPU es posible)

A100 de 40 GB para modelos grandes

VRAM

80 GB para fusiones de modelos de 70B

RAM

32 GB

64 GB+ (los modelos se cargan en la RAM)

CPU

8 núcleos

16+ núcleos

Almacenamiento

100 GB

500 GB+

SO

Ubuntu 20.04+

Ubuntu 22.04

Python

3.10+

3.11


Puertos

Puerto
Servicio
Notas

22

SSH

Acceso al terminal y transferencia de archivos

Mergekit se ejecuta como una herramienta de línea de comandos: no se necesita servidor web.


Instalación en Clore.ai

Paso 1 — Alquilar un servidor

  1. Filtra por RAM ≥ 64 GB (crítico para fusiones de modelos grandes)

  2. Elige Almacenamiento ≥ 500 GB (los modelos fusionados necesitan espacio para 2-4 modelos de entrada + la salida)

  3. La GPU es opcional, pero útil si quieres probar el modelo fusionado después

  4. Abrir puerto 22 solo

Paso 2 — Conectarse por SSH

Paso 3 — Instalar el entorno de Python

Paso 4 — Instalar Mergekit

Paso 5 — Instalar la CLI de HuggingFace

Paso 6 — Verificar la instalación


Descargando modelos para fusionar


Configuraciones de fusión

Mergekit utiliza archivos de configuración YAML para definir fusiones.

Ejemplo 1: Fusión SLERP (dos modelos)

SLERP mezcla dos modelos a lo largo de un arco esférico — mejor para modelos de la misma arquitectura:

Ejemplo 2: Fusión TIES (múltiples modelos)

TIES maneja la interferencia entre múltiples modelos fusionados:

Ejemplo 3: Fusión DARE-TIES (la mejor opción general)

Ejemplo 4: Aritmética de tareas (añadir capacidades)

Añade un "delta de habilidad" a un modelo base:

Ejemplo 5: MoE (mezcla de expertos)

Combina modelos en una arquitectura MoE dispersa:


Ejecutando la fusión

Comando básico

Supervisar el progreso


Probando el modelo fusionado


Publicando en HuggingFace


Avanzado: fusión evolutiva

Usa el optimizador evolutivo de Mergekit para encontrar los pesos óptimos de fusión:


Solución de problemas

Memoria insuficiente (OOM) durante la fusión

ValueError: los modelos no son compatibles

La fusión es muy lenta

El modelo fusionado produce galimatías

FileNotFoundError de archivos del modelo


Recetas populares de fusión

Asistente general + programación

Refuerzo multilingüe


Enlaces útiles


Recomendaciones de GPU para Clore.ai

Caso de uso
GPU recomendada
Costo estimado en Clore.ai

Desarrollo/Pruebas

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Fusión de modelos (7B–13B)

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

Modelos grandes (70B+)

A100 80GB

Fusión con varias GPU

2-4x A100 de 80 GB

💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.

Última actualización

¿Te fue útil?