For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mergekit 模型合并

Mergekit 是用于合并预训练大语言模型的权威工具包。它在 GitHub 上拥有 5K+ 星标,实现了所有主要的模型合并算法——SLERP、TIES、DARE、DARE-TIES、MoE 合并等——让你无需任何训练数据或 GPU 训练时间即可创建强大的新模型。


什么是 Mergekit?

模型合并是一种强大的技术,可将多个 LLM 的优势整合到单一模型中:

  • 无需训练 ——合并在权重空间中进行,而非通过反向传播

  • 组合能力 ——将编码模型与指令遵循模型融合

  • 减少弱点 ——通过集成平均掉各个模型的失败情况

  • 创建专家混合模型 ——将模型组合为稀疏 MoE 架构

  • 领域适配 ——将基础模型与领域专用模型合并

Mergekit 实现了所有最先进的算法:

算法
描述
最适合

SLERP

两个模型之间的球面线性插值

平滑融合两个相似模型

TIES

修剪冗余参数、选择符号并合并

以最小干扰组合多个模型

DARE

随机丢弃并重缩放参数

减少大规模合并中的参数干扰

DARE-TIES

DARE + TIES 结合

多模型合并的最佳全能方案

线性

简单加权平均

快速基准合并

任务算术

添加/减去任务向量

添加/移除特定能力

直通

直接复制层

MoE 构建

模型合并的效果出人意料地好。合并后的模型通常会通过结合互补知识,在基准测试中超越其父模型。HuggingFace 上的 MergeKit 社区托管了数千个合并模型。


服务器要求

组件
最低
推荐

GPU

不需要(可使用 CPU 合并)

大型模型需要 A100 40 GB

显存

70B 模型合并需要 80 GB

内存

32 GB

64 GB+(模型会加载到 RAM 中)

CPU

8 核

16 核以上

存储

100 GB

500 GB+

操作系统

Ubuntu 20.04+

Ubuntu 22.04

Python

3.10+

3.11


端口

端口
服务
备注

22

SSH

终端访问和文件传输

Mergekit 作为命令行工具运行——无需 Web 服务器。


在 Clore.ai 上安装

第 1 步——租用服务器

  1. 筛选条件: RAM ≥ 64 GB (对大型模型合并至关重要)

  2. 选择 存储空间 ≥ 500 GB (合并模型需要容纳 2–4 个输入模型加输出模型的空间)

  3. GPU 是可选的,但如果你想在之后测试合并模型,它会很有用

  4. 开放端口 22 即可

第 2 步 — 通过 SSH 连接

第 3 步——安装 Python 环境

第 4 步——安装 Mergekit

第 5 步——安装 HuggingFace CLI

第 6 步——验证安装


下载要合并的模型


合并配置

Mergekit 使用 YAML 配置文件定义合并。

示例 1:SLERP 合并(两个模型)

SLERP 沿球面弧线融合两个模型——最适合同一架构的模型:

示例 2:TIES 合并(多个模型)

TIES 可处理多个合并模型之间的干扰:

示例 3:DARE-TIES 合并(最佳全能方案)

示例 4:任务算术(添加能力)

向基础模型添加“技能增量”:

示例 5:MoE(专家混合)

将模型组合为稀疏 MoE 架构:


运行合并

基本命令

监控进度


测试合并后的模型


发布到 HuggingFace


高级:进化合并

使用 Mergekit 的进化优化器寻找最佳合并权重:


故障排查

合并期间内存不足(OOM)

ValueError:模型不兼容

合并速度非常慢

合并后的模型输出乱码

FileNotFoundError 针对模型文件


热门合并配方

通用助手 + 编码

多语言增强


有用链接


Clore.ai GPU 推荐

使用场景
推荐 GPU
Clore.ai 预计成本

开发/测试

RTX 3090(24GB)

$0.07–0.21/gpu/hr

模型合并(7B–13B)

RTX 4090(24GB)

$0.14–0.42/gpu/hr

大模型(70B+)

A100 80GB

多 GPU 合并

2–4× A100 80GB

💡 本指南中的所有示例都可以部署在 Clore.ai GPU 服务器上。浏览可用 GPU 并按小时租用——无需承诺,拥有完整 root 访问权限。

最后更新于

这有帮助吗?