SGLang
在 Clore.ai GPU 上部署 SGLang,借助 RadixAttention 实现高性能 LLM 服务
SGLang(Structured Generation Language)是由 LMSYS 团队开发的高性能 LLM 服务框架,该团队以 Vicuna 和 Chatbot Arena 方面的工作而闻名。它具有用于 KV 缓存共享的 RadixAttention、高效的 MoE(专家混合)支持,以及兼容 OpenAI 的 API——使其成为 CLORE.AI GPU 服务器上可用的最快开源推理引擎之一。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
服务器要求
RAM
16 GB
32 GB+
VRAM
8 GB
24 GB+
磁盘
50 GB
200 GB+
GPU
NVIDIA Turing+(RTX 2000+)
A100、H100、RTX 4090
在 CLORE.AI 上快速部署
Docker 镜像: lmsysorg/sglang:latest
端口: 22/tcp, 30000/http
环境变量:
HF_TOKEN
hf_xxx...
用于受限模型的 HuggingFace 令牌
CUDA_VISIBLE_DEVICES
0,1
要使用的 GPU
逐步设置
1. 在 CLORE.AI 上租用 GPU 服务器
访问 CLORE.AI 市场 并选择一台服务器:
7B 模型:最低 16 GB 显存(RTX 4080、A10)
13B 模型:24 GB 显存(RTX 3090、RTX 4090、A5000)
70B 模型:80 GB+ 显存(A100 80GB)或多 GPU
MoE 模型(Mixtral 8x7B):48 GB 显存或 2×24 GB
2. SSH 登录到你的服务器
3. 拉取 SGLang Docker 镜像
4. 启动 SGLang 服务器
基础启动(Llama 3.1 8B):
使用 HuggingFace 令牌:
多 GPU 上的 Qwen2.5 72B:
DeepSeek-V2(MoE 模型):
5. 检查服务器健康状态
6. 通过 CLORE.AI 代理从外部访问
你的 CLORE.AI 仪表板提供了一个 http_pub 端口 30000 的 URL:
在任何兼容 OpenAI 的客户端中,将此 URL 作为你的 base URL。
使用示例
示例 1:兼容 OpenAI 的聊天补全
示例 2:流式响应
示例 3:Python OpenAI 客户端
示例 4:使用 SGLang 原生 API 进行批量推理
SGLang 的原生 API 提供了额外的控制:
示例 5:受约束的 JSON 输出
SGLang 支持结构化输出生成:
配置
关键启动参数
--model-path
必需
HuggingFace 模型 ID 或本地路径
--host
127.0.0.1
绑定主机(使用 0.0.0.0 用于外部访问)
--port
30000
服务器端口
--tp
1
张量并行度(GPU 数量)
--dp
1
数据并行度
--dtype
auto
float16, bfloat16, float32
--mem-fraction-static
0.88
用于 KV 缓存的显存比例
--max-prefill-tokens
auto
单次预填充步骤中的最大 token 数
--context-length
模型最大值
覆盖最大上下文长度
--trust-remote-code
false
允许自定义模型代码
--quantization
none
awq, gptq, fp8
--load-format
auto
auto, pt, safetensors
--tokenizer-path
与模型相同
自定义 tokenizer 路径
量化选项
AWQ(推荐用于速度):
FP8(适用于 H100/A100):
性能提示
1. RadixAttention —— 关键优势
SGLang 的 RadixAttention 会自动为共享的提示前缀复用 KV 缓存。这对于以下场景尤其强大:
具有长系统提示的聊天机器人
带有重复上下文的 RAG 应用
共享相同前缀的批量 API 调用
无需额外配置——始终启用。
2. 增加 KV 缓存大小
注意不要设得太高——要为模型权重留出空间。
3. 长上下文的分块预填充
4. 启用 FlashInfer 后端
SGLang 在可用时会自动使用 FlashInfer(Ampere+ GPU):
5. 多 GPU 张量并行
对于无法装入单个 GPU 的模型:
每个 GPU 必须有足够的显存来容纳模型的一部分。
6. 针对吞吐量与延迟进行调优
低延迟(单用户):
高吞吐量(多用户):
故障排查
问题:“torch.cuda.OutOfMemoryError”
解决方案: 降低内存比例或使用量化:
问题:服务器无法启动(卡在加载)
问题:“trust_remote_code required”
在 --trust-remote-code 添加到启动命令中,用于具有自定义架构的模型(DeepSeek、Falcon 等)。
问题:MoE 模型生成缓慢
MoE 模型(Mixtral、DeepSeek)受内存带宽限制。确保你使用的是:
问题:上下文长度错误
问题:端口 30000 无法访问
请确认该端口已在你的 CLORE.AI 订单配置中暴露。检查订单仪表板中的 http_pub URL,而不是 localhost。
链接
Clore.ai GPU 推荐
开发/测试
RTX 3090(24GB)
$0.07–0.21/gpu/hr
生产环境(7B–13B)
RTX 4090(24GB)
$0.14–0.42/gpu/hr
大模型(70B+)
A100 80GB / H100
~$1.04/gpu/hr
💡 本指南中的所有示例都可以部署在 Clore.ai GPU 服务器上。浏览可用 GPU 并按小时租用——无需承诺,拥有完整 root 访问权限。
最后更新于
这有帮助吗?