For the complete documentation index, see llms.txt. This page is also available as Markdown.

微调工具对比

为在 Clore.ai GPU 服务器上训练 LLM 选择合适的微调框架。

微调 将预训练 LLM 适配到你的特定任务或领域。本指南对比了四款领先的开源工具:Unsloth、Axolotl、LLaMA-Factory 和 TRL——涵盖速度、内存效率、支持的模型以及易用性。


快速决策矩阵

Unsloth
Axolotl
LLaMA-Factory
TRL

最适合

速度 + 内存

配置驱动训练

适合初学者

研究 + RLHF

速度相较基线

快 2-5×

~1×(标准)

~1×(标准)

~1×(标准)

内存减少

减少 70-80%

QLoRA 标准

QLoRA 标准

标准

RLHF/DPO/PPO

基础

✅(原生支持)

WebUI

GitHub 星标

23K+

9K+

37K+

1万以上

许可证

LGPL(非商业用途免费)

Apache 2.0

Apache 2.0

Apache 2.0


概览

Unsloth

Unsloth 只专注一件事:让微调尽可能快、尽可能节省内存。它用 Triton 重写关键操作并优化 CUDA 内核。

理念:极致速度,最低 VRAM——毫不妥协。

Axolotl

Axolotl 用基于 YAML 的配置系统封装了 HuggingFace Transformers。它处理训练设置的复杂性,让你可以专注于数据和超参数。

理念:所有内容都在 YAML 中,底层拥有完全灵活性。

LLaMA-Factory

LLaMA-Factory 支持最广泛的模型(100+)和训练方法,并提供用于配置的 WebUI。它是非研究人员最易上手的选择。

理念:一切都能运行,适合所有人。

TRL(Transformer 强化学习)

TRL 是 HuggingFace 官方的 RLHF 库。它是 PPO、DPO、ORPO 以及其他对齐训练方法的标准方案。

理念:以研究为先,原生支持对齐训练。


速度基准

训练速度对比(tokens/秒)

测试设置:LLaMA 3.1 8B、LoRA r=16、4 位量化、批次大小 4、A100 80GB

工具
每秒 Token 数
相较基线
内存(VRAM)

Unsloth(4 位)

~4,200

2.8×

约 8GB

Axolotl(QLoRA)

~1,500

1.0×

~16GB

LLaMA-Factory(QLoRA)

~1,480

~1.0×

~16GB

TRL(QLoRA)

~1,450

~0.97×

~18GB

Unsloth(完整 16 位)

~2,800

1.9×

~22GB

VRAM 使用对比

训练 LLaMA 3.1 8B,序列长度 2048:

方法
Unsloth
Axolotl
LLaMA-Factory
TRL

全参数微调(bf16)

60GB

70GB

72GB

74GB

LoRA(bf16)

18GB

24GB

25GB

26GB

QLoRA(4 位)

8GB

16GB

16GB

18GB

QLoRA(4 位,长上下文)

12GB

24GB

24GB

26GB

8B 模型所需最低 GPU:

  • Unsloth:RTX 3080(10GB)✅

  • 其他方案:需要 RTX 3090(24GB)


支持的模型

模型支持矩阵

模型家族
Unsloth
Axolotl
LLaMA-Factory
TRL

LLaMA 3.x

LLaMA 2

Mistral

Mixtral MoE

Gemma 2

Phi-3/3.5

Qwen 2.5

DeepSeek

Falcon

GPT-NeoX

部分

T5/FLAN

BERT/RoBERTa

视觉 LLM

部分

部分

训练方法支持

方法
Unsloth
Axolotl
LLaMA-Factory
TRL

全量微调

LoRA

QLoRA

DoRA

PEFT

SFT

✅(原生支持)

DPO

✅(原生支持)

PPO

✅(原生支持)

ORPO

KTO

✅(原生支持)

GRPO

CPT(持续预训练)


Unsloth:深入解析

它为何如此快

  1. Triton 内核:用 Triton 重写 Flash Attention、交叉熵损失和 LoRA

  2. 融合操作:将多个 CUDA 操作合并为一个内核

  3. 智能梯度检查点:"unsloth" 模式可再节省约 30% 的内存

  4. 高效反向传播:避免生成大型中间张量

在 Clore.ai 上安装

完整训练脚本

弱点:没有 PPO,仅限支持的模型列表,LGPL 许可证(商业使用请确认)


Axolotl:深入解析

配置优先方法

当你需要可复现、可版本控制的训练配置时,Axolotl 表现出色:

最适合:希望获得可复现、按配置版本管理的训练运行的团队


LLaMA-Factory:深入解析

WebUI 使用说明

WebUI 选项卡:

  1. 训练 — 配置基础模型、数据集和方法

  2. 评估 — 运行 MMLU、CMMLU 基准测试

  3. 聊天 — 交互式推理

  4. 导出 — 合并 LoRA,量化为 GGUF

CLI 训练示例

最适合:初学者、希望使用 WebUI、以及不具备深厚研究知识也能进行 DPO/RLHF 的团队


TRL:深入解析

RLHF 流程示例

TRL 是对齐训练的首选:

最适合:对齐研究、RLHF、DPO、PPO、ORPO 的实现


选择合适的工具

决策流程

按团队类型

团队
推荐
原因

个人研究者

Unsloth

速度 + Jupyter 笔记本

机器学习工程师

Axolotl

配置驱动、可复现

产品团队

LLaMA-Factory

WebUI、广泛的模型支持

对齐团队

TRL

原生 RLHF 基础组件

初创团队

Unsloth + TRL

需要时兼顾速度 + 对齐


Clore.ai GPU 推荐

任务
最低 GPU
推荐
工具

7-8B LoRA(QLoRA)

RTX 3080(10GB)

RTX 3090

Unsloth

13B LoRA

RTX 3090(24GB)

A6000(48GB)

Unsloth/Axolotl

70B LoRA

A100(80GB)

2×A100

Axolotl/TRL

8B 全参数微调

A100(40GB)

A100(80GB)

任意

DPO/PPO 7B

RTX 4090(24GB)

A6000(48GB)

TRL


有用链接


总结

工具
最适合
主要优势

Unsloth

速度关键型训练,小型 GPU

快 2-5×,VRAM 减少 70%

Axolotl

配置驱动、可复现的运行

以 YAML 为先,支持多种数据格式

LLaMA-Factory

100+ 模型、WebUI、初学者

支持最多模型,GUI

TRL

RLHF、DPO、对齐研究

原生对齐训练

对于大多数 Clore.ai 使用场景:先从 Unsloth (速度 + 内存效率)开始,再添加 TRL 如果你需要 DPO 或 PPO 对齐训练。

最后更新于

这有帮助吗?