For the complete documentation index, see llms.txt. This page is also available as Markdown.

DeepSpeed 训练

在 Clore.ai GPU 上使用 DeepSpeed 高效训练大模型

使用 Microsoft DeepSpeed 高效训练大型模型。

在 CLORE.AI 上租用

  1. 按 GPU 类型、VRAM 和价格筛选

  2. 选择 按需 (固定费率)或 竞价 (出价)

  3. 配置你的订单:

    • 选择 Docker 镜像

    • 设置端口(SSH 用 TCP,Web UI 用 HTTP)

    • 如有需要,添加环境变量

    • 输入启动命令

  4. 选择支付方式: CLORE, BTC,或 USDT/USDC

  5. 创建订单并等待部署

访问你的服务器

  • 在以下位置查找连接信息 我的订单

  • Web 界面:使用 HTTP 端口 URL

  • SSH: ssh -p <port> root@<proxy-address>

什么是 DeepSpeed?

DeepSpeed 支持:

  • 训练无法放入 GPU 内存的模型

  • 多 GPU 和多节点训练

  • ZeRO 优化(内存效率)

  • 混合精度训练

ZeRO 阶段

阶段
内存节省
速度

ZeRO-1

优化器状态分区

ZeRO-2

+ 梯度分区

平衡

ZeRO-3

+ 参数分区

最大节省

ZeRO-Infinity

CPU/NVMe 卸载

最大规模模型

快速部署

Docker 镜像:

端口:

命令:

安装

基础训练

DeepSpeed 配置

ds_config.json:

训练脚本

ZeRO 第 2 阶段配置

ZeRO 第 3 阶段配置

适用于大型模型:

结合 Hugging Face Transformers

Trainer 集成

多 GPU 训练

启动命令

使用 torchrun

多节点训练

主机文件

hostfile:

启动

SSH 设置

内存高效配置

24GB GPU 上的 7B 模型

24GB GPU 上的 13B 模型

梯度检查点

通过重计算激活来节省内存:

保存和加载检查点

保存

加载

保存为 HuggingFace 格式

监控

TensorBoard

Weights & Biases

常见问题

内存不足

训练缓慢

  • 减少 CPU 卸载

  • 增大批大小

  • 使用 ZeRO 第 2 阶段而不是第 3 阶段

NCCL 错误

性能提示

提示
效果

优先使用 bf16 而不是 fp16

更好的稳定性

启用梯度检查点

更少内存

调优批大小

更高吞吐量

使用 NVMe 卸载

更大型模型

性能对比

模型
GPU
ZeRO 阶段
训练速度

7B

1x A100

ZeRO-3

~1000 tokens/s

7B

4x A100

ZeRO-2

~4000 tokens/s

13B

4x A100

ZeRO-3

~2000 tokens/s

70B

8x A100

ZeRO-3

~800 tokens/s

故障排查

成本估算

CLORE.AI 市场常见费率(截至 2024 年):

GPU
小时费率
日费率
4 小时会话

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40GB

~$0.17

~$4.00

~$0.70

A100 80GB

~$0.25

~$6.00

~$1.00

价格因提供商和需求而异。请查看 CLORE.AI 市场 以获取当前费率。

节省费用:

  • 使用 竞价 可中断工作市场——约三分之一的服务器将现货价格定得低于按需价格(中位数约优惠 13%),其余则与按需价格持平

  • 使用 CLORE 代币支付

  • 比较不同提供商的价格

下一步

最后更新于

这有帮助吗?