微调工具对比
为在 Clore.ai GPU 服务器上训练 LLM 选择合适的微调框架。
快速决策矩阵
最适合
速度 + 内存
配置驱动训练
适合初学者
研究 + RLHF
速度相较基线
快 2-5×
~1×(标准)
~1×(标准)
~1×(标准)
内存减少
减少 70-80%
QLoRA 标准
QLoRA 标准
标准
RLHF/DPO/PPO
基础
✅
✅
✅(原生支持)
WebUI
❌
❌
✅
❌
GitHub 星标
23K+
9K+
37K+
1万以上
许可证
LGPL(非商业用途免费)
Apache 2.0
Apache 2.0
Apache 2.0
概览
Unsloth
Unsloth 只专注一件事:让微调尽可能快、尽可能节省内存。它用 Triton 重写关键操作并优化 CUDA 内核。
理念:极致速度,最低 VRAM——毫不妥协。
Axolotl
Axolotl 用基于 YAML 的配置系统封装了 HuggingFace Transformers。它处理训练设置的复杂性,让你可以专注于数据和超参数。
理念:所有内容都在 YAML 中,底层拥有完全灵活性。
LLaMA-Factory
LLaMA-Factory 支持最广泛的模型(100+)和训练方法,并提供用于配置的 WebUI。它是非研究人员最易上手的选择。
理念:一切都能运行,适合所有人。
TRL(Transformer 强化学习)
TRL 是 HuggingFace 官方的 RLHF 库。它是 PPO、DPO、ORPO 以及其他对齐训练方法的标准方案。
理念:以研究为先,原生支持对齐训练。
速度基准
训练速度对比(tokens/秒)
测试设置:LLaMA 3.1 8B、LoRA r=16、4 位量化、批次大小 4、A100 80GB
Unsloth(4 位)
~4,200
2.8×
约 8GB
Axolotl(QLoRA)
~1,500
1.0×
~16GB
LLaMA-Factory(QLoRA)
~1,480
~1.0×
~16GB
TRL(QLoRA)
~1,450
~0.97×
~18GB
Unsloth(完整 16 位)
~2,800
1.9×
~22GB
Unsloth 的优势确实存在:2-5× 的速度提升来自用于注意力、交叉熵、RoPE 和 LoRA 的自定义 Triton 内核,不只是营销。
VRAM 使用对比
训练 LLaMA 3.1 8B,序列长度 2048:
全参数微调(bf16)
60GB
70GB
72GB
74GB
LoRA(bf16)
18GB
24GB
25GB
26GB
QLoRA(4 位)
8GB
16GB
16GB
18GB
QLoRA(4 位,长上下文)
12GB
24GB
24GB
26GB
8B 模型所需最低 GPU:
Unsloth:RTX 3080(10GB)✅
其他方案:需要 RTX 3090(24GB)
支持的模型
模型支持矩阵
LLaMA 3.x
✅
✅
✅
✅
LLaMA 2
✅
✅
✅
✅
Mistral
✅
✅
✅
✅
Mixtral MoE
✅
✅
✅
✅
Gemma 2
✅
✅
✅
✅
Phi-3/3.5
✅
✅
✅
✅
Qwen 2.5
✅
✅
✅
✅
DeepSeek
✅
✅
✅
✅
Falcon
✅
✅
✅
✅
GPT-NeoX
部分
✅
✅
✅
T5/FLAN
❌
✅
✅
✅
BERT/RoBERTa
❌
✅
✅
✅
视觉 LLM
部分
部分
✅
✅
训练方法支持
全量微调
✅
✅
✅
✅
LoRA
✅
✅
✅
✅
QLoRA
✅
✅
✅
✅
DoRA
✅
✅
✅
❌
PEFT
✅
✅
✅
✅
SFT
✅
✅
✅
✅(原生支持)
DPO
✅
✅
✅
✅(原生支持)
PPO
❌
✅
✅
✅(原生支持)
ORPO
✅
✅
✅
✅
KTO
❌
✅
✅
✅(原生支持)
GRPO
✅
❌
✅
✅
CPT(持续预训练)
✅
✅
✅
✅
Unsloth:深入解析
它为何如此快
Triton 内核:用 Triton 重写 Flash Attention、交叉熵损失和 LoRA
融合操作:将多个 CUDA 操作合并为一个内核
智能梯度检查点:"unsloth" 模式可再节省约 30% 的内存
高效反向传播:避免生成大型中间张量
在 Clore.ai 上安装
完整训练脚本
弱点:没有 PPO,仅限支持的模型列表,LGPL 许可证(商业使用请确认)
Axolotl:深入解析
配置优先方法
当你需要可复现、可版本控制的训练配置时,Axolotl 表现出色:
最适合:希望获得可复现、按配置版本管理的训练运行的团队
LLaMA-Factory:深入解析
WebUI 使用说明
WebUI 选项卡:
训练 — 配置基础模型、数据集和方法
评估 — 运行 MMLU、CMMLU 基准测试
聊天 — 交互式推理
导出 — 合并 LoRA,量化为 GGUF
CLI 训练示例
最适合:初学者、希望使用 WebUI、以及不具备深厚研究知识也能进行 DPO/RLHF 的团队
TRL:深入解析
RLHF 流程示例
TRL 是对齐训练的首选:
最适合:对齐研究、RLHF、DPO、PPO、ORPO 的实现
选择合适的工具
决策流程
按团队类型
个人研究者
Unsloth
速度 + Jupyter 笔记本
机器学习工程师
Axolotl
配置驱动、可复现
产品团队
LLaMA-Factory
WebUI、广泛的模型支持
对齐团队
TRL
原生 RLHF 基础组件
初创团队
Unsloth + TRL
需要时兼顾速度 + 对齐
Clore.ai GPU 推荐
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
7-8B LoRA(QLoRA)
RTX 3080(10GB)
RTX 3090
Unsloth
13B LoRA
RTX 3090(24GB)
A6000(48GB)
Unsloth/Axolotl
70B LoRA
A100(80GB)
2×A100
Axolotl/TRL
8B 全参数微调
A100(40GB)
A100(80GB)
任意
DPO/PPO 7B
RTX 4090(24GB)
A6000(48GB)
TRL
有用链接
Unsloth GitHub — 23K+ 星标
Axolotl GitHub — 9K+ 星标
LLaMA-Factory GitHub — 37K+ 星标
TRL GitHub — 10K+ 星标
总结
Unsloth
速度关键型训练,小型 GPU
快 2-5×,VRAM 减少 70%
Axolotl
配置驱动、可复现的运行
以 YAML 为先,支持多种数据格式
LLaMA-Factory
100+ 模型、WebUI、初学者
支持最多模型,GUI
TRL
RLHF、DPO、对齐研究
原生对齐训练
对于大多数 Clore.ai 使用场景:先从 Unsloth (速度 + 内存效率)开始,再添加 TRL 如果你需要 DPO 或 PPO 对齐训练。
最后更新于
这有帮助吗?