LitGPT
LitGPT 是一个用于预训练、微调和部署 20+ 个基于 PyTorch Lightning 构建的大语言模型的高性能库。它在 GitHub 上拥有 12K+ 星标,是需要简洁、可改造的 LLM 训练代码、又不想承担 HuggingFace Transformers 抽象开销的工程师首选工具包。
LitGPT 中的每个模型大约只有 1,000 行干净的 PyTorch 代码——没有层层嵌套 10 层深的继承链,没有魔法。你可以在一个下午内通读 Llama 3 的实现,并自信地修改它。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
什么是 LitGPT?
LitGPT 通过统一的训练接口,提供最先进 LLM 的生产可用实现:
支持 20+ 个模型 — Llama 3、Gemma 2、Mistral、Phi-3、Falcon、StableLM 等
从零开始预训练 — 使用 Flash Attention、FSDP 和梯度检查点进行完整预训练
高效微调 — 完整微调、LoRA、QLoRA 和 Adapter 方法
放心部署 — 内置带量化的推理服务器
多 GPU 支持 — 开箱即用的 DDP、FSDP、张量并行
内存高效 — 4 位量化、梯度检查点、激活检查点
服务器要求
GPU
RTX 3090(24 GB)
A100 80 GB / H100
显存
16 GB(7B LoRA)
80 GB+(70B 完整)
内存
32 GB
64 GB+
CPU
8 核
16+ 核
存储
100 GB
500 GB+
操作系统
Ubuntu 20.04+
Ubuntu 22.04
Python
3.10+
3.11
CUDA
12.8+
12.8+
按任务划分的 VRAM 需求
推理(4 位)
Llama-3 8B
~6 GB
LoRA 微调
Llama-3 8B
~16 GB
完整微调
Llama-3 8B
约 80 GB
LoRA 微调
Llama-3 70B
~48 GB(2×A100)
完整微调
Llama-3 70B
~640 GB(8×A100)
QLoRA 微调
Llama-3 8B
~8 GB
端口
22
SSH
终端访问和文件传输
8000
LitGPT 推理服务器
用于模型服务的 REST API
使用 Docker 快速开始
在 Clore.ai 上安装
步骤 1 — 租用服务器
前往 Clore.ai 市场
筛选 VRAM ≥ 24 GB (RTX 3090 或更好)
选择一个 PyTorch 或 CUDA 12.8 基础镜像
开放端口 22 以及 8000 在你的订单设置中
选择 存储空间 ≥ 200 GB 用于模型权重
步骤 2 — 通过 SSH 连接
第 3 步——安装 LitGPT
第 4 步——验证安装
预期输出:
下载模型
LitGPT 从 Hugging Face 下载模型:
设置 HuggingFace Token
推理(聊天与生成)
微调
LoRA 微调(推荐)
LoRA 只训练一小部分适配器参数(通常占总权重的 0.1–1%),而基础模型保持冻结。使用 10K 个样本在 RTX 3090 上训练 Llama 3 8B LoRA 大约需要 2 小时,且 r=16.
QLoRA(4 位 + LoRA)
使用 QLoRA 可在有限 VRAM 上微调大型模型。Llama 3 8B 可以在一张 24 GB 的 RTX 3090 上运行:
完整微调
多 GPU 训练
模型服务(REST API)
Python 客户端
从零开始预训练
用于基于你自己的数据从零训练自定义 LLM:
转换和导出模型
评估模型
Clore.ai GPU 推荐
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
LitGPT 覆盖三种不同的工作负载——推理、LoRA 微调和完整预训练——每种都有不同的 GPU 需求。
推理 / 聊天(7–8B 模型)
RTX 3090
24 GB
在 bf16 下可容纳 Llama 3 8B;生成速度约 95 tok/s
LoRA 微调(7–8B 模型)
RTX 3090
24 GB
经济之选;QLoRA 可将 VRAM 控制在 10 GB 以下
LoRA 微调(7–8B),快速迭代
RTX 4090
24 GB
比 3090 快约 35%;将 2 小时任务缩短到约 1.4 小时
完整微调(7B)或 QLoRA(70B)
A100 40 GB
40 GB
40 GB 可容纳 7B 全精度或 70B 4 位模型
完整微调(13B+)或预训练运行
A100 80 GB
80 GB
吞吐量最高;在 8B 上训练速度约 2,800 tok/sec
推荐给大多数用户: RTX 3090 双卡组合(2×24 GB = 使用 FSDP 时等效 48 GB)。可处理 70B 模型上的 QLoRA,或通过张量并行对 7B 模型进行完整微调。在 Clore.ai 上,两张 3090 的价格为每小时 $0.07–0.21。
用于预训练或 70B 以上微调: 使用 4×A100 80GB 和 FSDP。LitGPT 的 FSDP 集成会透明地处理分片——只需传入 --devices 4 --strategy fsdp.
故障排查
CUDA 显存不足
下载失败 / HuggingFace 401
训练损失没有下降
服务器端口 8000 无法访问
多 GPU 训练卡住
有用链接
GitHub: https://github.com/Lightning-AI/litgpt ⭐ 12K+
PyTorch Lightning: https://lightning.ai
HuggingFace 模型: https://huggingface.co/models
Discord: https://discord.gg/lightning-ai
Clore.ai 市场: https://clore.ai/marketplace
最后更新于
这有帮助吗?