For the complete documentation index, see llms.txt. This page is also available as Markdown.

SGLang

在 Clore.ai GPU 上部署 SGLang,借助 RadixAttention 实现高性能 LLM 服务

SGLang(Structured Generation Language)是由 LMSYS 团队开发的高性能 LLM 服务框架,该团队以 Vicuna 和 Chatbot Arena 方面的工作而闻名。它具有用于 KV 缓存共享的 RadixAttention、高效的 MoE(专家混合)支持,以及兼容 OpenAI 的 API——使其成为 CLORE.AI GPU 服务器上可用的最快开源推理引擎之一。

服务器要求

参数
最低
推荐

RAM

16 GB

32 GB+

VRAM

8 GB

24 GB+

磁盘

50 GB

200 GB+

GPU

NVIDIA Turing+(RTX 2000+)

A100、H100、RTX 4090

SGLang 在启用 FlashInfer 的 Ampere+ GPU 上可获得最佳性能。对于 Mixtral 或 DeepSeek 之类的 MoE 模型,建议使用多 GPU 设置。

在 CLORE.AI 上快速部署

Docker 镜像: lmsysorg/sglang:latest

端口: 22/tcp, 30000/http

环境变量:

变量
示例
描述

HF_TOKEN

hf_xxx...

用于受限模型的 HuggingFace 令牌

CUDA_VISIBLE_DEVICES

0,1

要使用的 GPU

逐步设置

1. 在 CLORE.AI 上租用 GPU 服务器

访问 CLORE.AI 市场 并选择一台服务器:

  • 7B 模型:最低 16 GB 显存(RTX 4080、A10)

  • 13B 模型:24 GB 显存(RTX 3090、RTX 4090、A5000)

  • 70B 模型:80 GB+ 显存(A100 80GB)或多 GPU

  • MoE 模型(Mixtral 8x7B):48 GB 显存或 2×24 GB

2. SSH 登录到你的服务器

3. 拉取 SGLang Docker 镜像

4. 启动 SGLang 服务器

基础启动(Llama 3.1 8B):

使用 HuggingFace 令牌:

多 GPU 上的 Qwen2.5 72B:

DeepSeek-V2(MoE 模型):

5. 检查服务器健康状态

6. 通过 CLORE.AI 代理从外部访问

你的 CLORE.AI 仪表板提供了一个 http_pub 端口 30000 的 URL:

在任何兼容 OpenAI 的客户端中,将此 URL 作为你的 base URL。


使用示例

示例 1:兼容 OpenAI 的聊天补全

示例 2:流式响应

示例 3:Python OpenAI 客户端

示例 4:使用 SGLang 原生 API 进行批量推理

SGLang 的原生 API 提供了额外的控制:

示例 5:受约束的 JSON 输出

SGLang 支持结构化输出生成:


配置

关键启动参数

参数
默认值
描述

--model-path

必需

HuggingFace 模型 ID 或本地路径

--host

127.0.0.1

绑定主机(使用 0.0.0.0 用于外部访问)

--port

30000

服务器端口

--tp

1

张量并行度(GPU 数量)

--dp

1

数据并行度

--dtype

auto

float16, bfloat16, float32

--mem-fraction-static

0.88

用于 KV 缓存的显存比例

--max-prefill-tokens

auto

单次预填充步骤中的最大 token 数

--context-length

模型最大值

覆盖最大上下文长度

--trust-remote-code

false

允许自定义模型代码

--quantization

none

awq, gptq, fp8

--load-format

auto

auto, pt, safetensors

--tokenizer-path

与模型相同

自定义 tokenizer 路径

量化选项

AWQ(推荐用于速度):

FP8(适用于 H100/A100):


性能提示

1. RadixAttention —— 关键优势

SGLang 的 RadixAttention 会自动为共享的提示前缀复用 KV 缓存。这对于以下场景尤其强大:

  • 具有长系统提示的聊天机器人

  • 带有重复上下文的 RAG 应用

  • 共享相同前缀的批量 API 调用

无需额外配置——始终启用。

2. 增加 KV 缓存大小

注意不要设得太高——要为模型权重留出空间。

3. 长上下文的分块预填充

4. 启用 FlashInfer 后端

SGLang 在可用时会自动使用 FlashInfer(Ampere+ GPU):

5. 多 GPU 张量并行

对于无法装入单个 GPU 的模型:

每个 GPU 必须有足够的显存来容纳模型的一部分。

6. 针对吞吐量与延迟进行调优

低延迟(单用户):

高吞吐量(多用户):


故障排查

问题:“torch.cuda.OutOfMemoryError”

解决方案: 降低内存比例或使用量化:

问题:服务器无法启动(卡在加载)

问题:“trust_remote_code required”

--trust-remote-code 添加到启动命令中,用于具有自定义架构的模型(DeepSeek、Falcon 等)。

问题:MoE 模型生成缓慢

MoE 模型(Mixtral、DeepSeek)受内存带宽限制。确保你使用的是:

问题:上下文长度错误

问题:端口 30000 无法访问

请确认该端口已在你的 CLORE.AI 订单配置中暴露。检查订单仪表板中的 http_pub URL,而不是 localhost。


链接


Clore.ai GPU 推荐

使用场景
推荐 GPU
Clore.ai 预计成本

开发/测试

RTX 3090(24GB)

$0.07–0.21/gpu/hr

生产环境(7B–13B)

RTX 4090(24GB)

$0.14–0.42/gpu/hr

大模型(70B+)

A100 80GB / H100

~$1.04/gpu/hr

💡 本指南中的所有示例都可以部署在 Clore.ai GPU 服务器上。浏览可用 GPU 并按小时租用——无需承诺,拥有完整 root 访问权限。

最后更新于

这有帮助吗?