DeepSpeed 训练
在 Clore.ai GPU 上使用 DeepSpeed 高效训练大模型
使用 Microsoft DeepSpeed 高效训练大型模型。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
在 CLORE.AI 上租用
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
访问 CLORE.AI 市场
按 GPU 类型、VRAM 和价格筛选
选择 按需 (固定费率)或 竞价 (出价)
配置你的订单:
选择 Docker 镜像
设置端口(SSH 用 TCP,Web UI 用 HTTP)
如有需要,添加环境变量
输入启动命令
选择支付方式: CLORE, BTC,或 USDT/USDC
创建订单并等待部署
访问你的服务器
在以下位置查找连接信息 我的订单
Web 界面:使用 HTTP 端口 URL
SSH:
ssh -p <port> root@<proxy-address>
什么是 DeepSpeed?
DeepSpeed 支持:
训练无法放入 GPU 内存的模型
多 GPU 和多节点训练
ZeRO 优化(内存效率)
混合精度训练
ZeRO 阶段
ZeRO-1
优化器状态分区
快
ZeRO-2
+ 梯度分区
平衡
ZeRO-3
+ 参数分区
最大节省
ZeRO-Infinity
CPU/NVMe 卸载
最大规模模型
快速部署
Docker 镜像:
端口:
命令:
安装
基础训练
DeepSpeed 配置
ds_config.json:
训练脚本
ZeRO 第 2 阶段配置
ZeRO 第 3 阶段配置
适用于大型模型:
结合 Hugging Face Transformers
Trainer 集成
多 GPU 训练
启动命令
使用 torchrun
多节点训练
主机文件
hostfile:
启动
SSH 设置
内存高效配置
24GB GPU 上的 7B 模型
24GB GPU 上的 13B 模型
梯度检查点
通过重计算激活来节省内存:
保存和加载检查点
保存
加载
保存为 HuggingFace 格式
监控
TensorBoard
Weights & Biases
常见问题
内存不足
训练缓慢
减少 CPU 卸载
增大批大小
使用 ZeRO 第 2 阶段而不是第 3 阶段
NCCL 错误
性能提示
优先使用 bf16 而不是 fp16
更好的稳定性
启用梯度检查点
更少内存
调优批大小
更高吞吐量
使用 NVMe 卸载
更大型模型
性能对比
7B
1x A100
ZeRO-3
~1000 tokens/s
7B
4x A100
ZeRO-2
~4000 tokens/s
13B
4x A100
ZeRO-3
~2000 tokens/s
70B
8x A100
ZeRO-3
~800 tokens/s
故障排查
成本估算
CLORE.AI 市场常见费率(截至 2024 年):
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40GB
~$0.17
~$4.00
~$0.70
A100 80GB
~$0.25
~$6.00
~$1.00
价格因提供商和需求而异。请查看 CLORE.AI 市场 以获取当前费率。
节省费用:
使用 竞价 可中断工作市场——约三分之一的服务器将现货价格定得低于按需价格(中位数约优惠 13%),其余则与按需价格持平
使用 CLORE 代币支付
比较不同提供商的价格
下一步
微调 LLM - LoRA 训练
vLLM 推理 - 部署训练好的模型
Hugging Face 指南 - Transformers 库
最后更新于
这有帮助吗?