For the complete documentation index, see llms.txt. This page is also available as Markdown.

LitGPT

LitGPT 是一个用于预训练、微调和部署 20+ 个基于 PyTorch Lightning 构建的大语言模型的高性能库。它在 GitHub 上拥有 12K+ 星标,是需要简洁、可改造的 LLM 训练代码、又不想承担 HuggingFace Transformers 抽象开销的工程师首选工具包。

LitGPT 中的每个模型大约只有 1,000 行干净的 PyTorch 代码——没有层层嵌套 10 层深的继承链,没有魔法。你可以在一个下午内通读 Llama 3 的实现,并自信地修改它。


什么是 LitGPT?

LitGPT 通过统一的训练接口,提供最先进 LLM 的生产可用实现:

  • 支持 20+ 个模型 — Llama 3、Gemma 2、Mistral、Phi-3、Falcon、StableLM 等

  • 从零开始预训练 — 使用 Flash Attention、FSDP 和梯度检查点进行完整预训练

  • 高效微调 — 完整微调、LoRA、QLoRA 和 Adapter 方法

  • 放心部署 — 内置带量化的推理服务器

  • 多 GPU 支持 — 开箱即用的 DDP、FSDP、张量并行

  • 内存高效 — 4 位量化、梯度检查点、激活检查点


服务器要求

组件
最低
推荐

GPU

RTX 3090(24 GB)

A100 80 GB / H100

显存

16 GB(7B LoRA)

80 GB+(70B 完整)

内存

32 GB

64 GB+

CPU

8 核

16+ 核

存储

100 GB

500 GB+

操作系统

Ubuntu 20.04+

Ubuntu 22.04

Python

3.10+

3.11

CUDA

12.8+

12.8+

按任务划分的 VRAM 需求

任务
模型
显存

推理(4 位)

Llama-3 8B

~6 GB

LoRA 微调

Llama-3 8B

~16 GB

完整微调

Llama-3 8B

约 80 GB

LoRA 微调

Llama-3 70B

~48 GB(2×A100)

完整微调

Llama-3 70B

~640 GB(8×A100)

QLoRA 微调

Llama-3 8B

~8 GB


端口

端口
服务
备注

22

SSH

终端访问和文件传输

8000

LitGPT 推理服务器

用于模型服务的 REST API


使用 Docker 快速开始


在 Clore.ai 上安装

步骤 1 — 租用服务器

  1. 筛选 VRAM ≥ 24 GB (RTX 3090 或更好)

  2. 选择一个 PyTorchCUDA 12.8 基础镜像

  3. 开放端口 22 以及 8000 在你的订单设置中

  4. 选择 存储空间 ≥ 200 GB 用于模型权重

步骤 2 — 通过 SSH 连接

第 3 步——安装 LitGPT

第 4 步——验证安装

预期输出:


下载模型

LitGPT 从 Hugging Face 下载模型:

设置 HuggingFace Token


推理(聊天与生成)


微调

LoRA 微调(推荐)

LoRA 只训练一小部分适配器参数(通常占总权重的 0.1–1%),而基础模型保持冻结。使用 10K 个样本在 RTX 3090 上训练 Llama 3 8B LoRA 大约需要 2 小时,且 r=16.

QLoRA(4 位 + LoRA)

使用 QLoRA 可在有限 VRAM 上微调大型模型。Llama 3 8B 可以在一张 24 GB 的 RTX 3090 上运行:

完整微调

多 GPU 训练


模型服务(REST API)

Python 客户端


从零开始预训练

用于基于你自己的数据从零训练自定义 LLM:


转换和导出模型


评估模型


Clore.ai GPU 推荐

LitGPT 覆盖三种不同的工作负载——推理、LoRA 微调和完整预训练——每种都有不同的 GPU 需求。

工作负载
GPU
显存
备注

推理 / 聊天(7–8B 模型)

RTX 3090

24 GB

在 bf16 下可容纳 Llama 3 8B;生成速度约 95 tok/s

LoRA 微调(7–8B 模型)

RTX 3090

24 GB

经济之选;QLoRA 可将 VRAM 控制在 10 GB 以下

LoRA 微调(7–8B),快速迭代

RTX 4090

24 GB

比 3090 快约 35%;将 2 小时任务缩短到约 1.4 小时

完整微调(7B)或 QLoRA(70B)

A100 40 GB

40 GB

40 GB 可容纳 7B 全精度或 70B 4 位模型

完整微调(13B+)或预训练运行

A100 80 GB

80 GB

吞吐量最高;在 8B 上训练速度约 2,800 tok/sec

推荐给大多数用户: RTX 3090 双卡组合(2×24 GB = 使用 FSDP 时等效 48 GB)。可处理 70B 模型上的 QLoRA,或通过张量并行对 7B 模型进行完整微调。在 Clore.ai 上,两张 3090 的价格为每小时 $0.07–0.21。

用于预训练或 70B 以上微调: 使用 4×A100 80GB 和 FSDP。LitGPT 的 FSDP 集成会透明地处理分片——只需传入 --devices 4 --strategy fsdp.


故障排查

CUDA 显存不足

下载失败 / HuggingFace 401

训练损失没有下降

服务器端口 8000 无法访问

多 GPU 训练卡住


有用链接

最后更新于

这有帮助吗?