For the complete documentation index, see llms.txt. This page is also available as Markdown.

vLLM

在 Clore.ai GPU 上使用 vLLM 进行高吞吐量 LLM 推理

适用于 CLORE.AI GPU 上生产工作负载的高吞吐量 LLM 推理服务器。

当前版本:v0.7.x — 本指南涵盖 vLLM v0.7.3+。新功能包括对 DeepSeek-R1 的支持、带自动工具选择的结构化输出、多 LoRA 服务,以及更好的内存效率。

服务器要求

参数
最低
推荐

内存

16GB

32GB+

显存

16GB(7B)

24GB+

网络

500Mbps

1Gbps+

启动时间

5-15 分钟

-

需要匹配的 GPU? RTX 4090(24GB) 足以轻松处理 7B–13B;对于 70B+ 模型, H100(80GB) 是最稳妥的选择。

为什么选择 vLLM?

  • 最高吞吐量 - PagedAttention 带来 24 倍更高的吞吐量

  • 可直接用于生产 - 开箱即用的 OpenAI 兼容 API

  • 持续批处理 - 高效的多用户服务

  • 流式输出 - 实时生成 token

  • 多 GPU - 面向大模型的张量并行

  • 多 LoRA - 可同时提供多个微调适配器(v0.7+)

  • 结构化输出 - JSON Schema 约束和工具调用(v0.7+)

在 CLORE.AI 上快速部署

Docker 镜像:

端口:

命令:

验证是否正常工作

部署后,找到你的 http_pub URL,在 我的订单:

访问你的服务

在 CLORE.AI 上部署后,可通过以下方式访问 vLLM: http_pub URL:

所有 localhost:8000 下面的示例在通过 SSH 连接时可用。对于外部访问,请替换为你的 https://your-http-pub.clorecloud.net/ URL。

安装

使用 Docker(推荐)

使用 pip

支持的模型

模型
参数量
所需 VRAM
所需 RAM

Mistral 7B

7B

14GB

16GB+

Llama 3.1 8B

8B

16GB

16GB+

Llama 3.1 70B

70B

140GB(或 2x80GB)

64GB+

Mixtral 8x7B

47B

90GB

32GB+

Qwen2.5 7B

7B

14GB

16GB+

Qwen2.5 72B

72B

145GB

64GB+

DeepSeek-V3

236B MoE

多 GPU

128GB+

DeepSeek-R1-Distill-Qwen-7B

7B

14GB

16GB+

DeepSeek-R1-Distill-Qwen-32B

32B

64GB

32GB+

DeepSeek-R1-Distill-Llama-70B

70B

140GB

64GB+

Phi-4

14B

28GB

32GB+

Gemma 2 9B

9B

18GB

16GB+

CodeLlama 34B

34B

68GB

32GB+

服务器选项

基础服务器

生产服务器

使用量化(更低 VRAM)

结构化输出和工具调用(v0.7+)

启用自动工具选择和结构化 JSON 输出:

在 Python 中使用:

通过 response format 输出结构化 JSON:

多 LoRA 服务(v0.7+)

同时使用多个 LoRA 适配器为一个基础模型提供服务:

按模型名称查询特定的 LoRA 适配器:

DeepSeek-R1 支持(v0.7+)

vLLM v0.7+ 原生支持 DeepSeek-R1 蒸馏模型。这些推理模型会生成 <think> 标签,展示它们的推理过程。

DeepSeek-R1-Distill-Qwen-7B(单 GPU)

DeepSeek-R1-Distill-Qwen-32B(双 GPU)

DeepSeek-R1-Distill-Llama-70B(四 GPU)

查询 DeepSeek-R1

解析 think 标签:

API 用法

聊天补全(OpenAI 兼容)

流式输出

cURL

文本补全

完整 API 参考

vLLM 提供 OpenAI 兼容端点,以及额外的实用端点。

标准端点

端点
方法
说明

/v1/models

GET

列出可用模型

/v1/chat/completions

POST

聊天补全

/v1/completions

POST

文本补全

/health

GET

健康检查(可能返回空)

附加端点

端点
方法
说明

/tokenize

POST

将文本分词

/detokenize

POST

将 token 转换为文本

/version

GET

获取 vLLM 版本

/docs

GET

Swagger UI 文档

/metrics

GET

Prometheus 指标

文本分词

在发送请求前用于统计 token 数量:

响应:

反分词

将 token ID 转回文本:

响应:

获取版本

响应:

Swagger 文档

在浏览器中打开以查看交互式 API 文档:

Prometheus 指标

用于监控:

推理模型: DeepSeek-R1 及类似模型包含 <think> 响应中的标签,用于在最终答案之前展示模型的推理过程。

基准测试

吞吐量(每用户 tokens/秒)

模型
RTX 3090
RTX 4090
A100 40GB
A100 80GB

Mistral 7B

100

170

210

230

Llama 3.1 8B

95

150

200

220

Llama 3.1 8B(AWQ)

130

190

260

280

Mixtral 8x7B

-

45

70

85

Llama 3.1 70B

-

-

25(2x)

45(2x)

DeepSeek-R1 7B

90

145

190

210

DeepSeek-R1 32B

-

-

40

70(2x)

基准测试更新于 2026 年 1 月。

上下文长度与 VRAM

模型
4K 上下文
8K 上下文
16K 上下文
32K 上下文

8B FP16

18GB

22GB

30GB

46GB

8B AWQ

8GB

10GB

14GB

22GB

70B FP16

145GB

160GB

190GB

250GB

70B AWQ

42GB

50GB

66GB

98GB

Hugging Face 身份验证

适用于受限模型(Llama 等):

或者设置为环境变量:

GPU 要求

模型
最低 VRAM
最低 RAM
推荐

7-8B

16GB

16GB

24GB VRAM,32GB RAM

13B

26GB

32GB

40GB VRAM

34B

70GB

32GB

80GB VRAM

70B

140GB

64GB

2x80GB

成本估算

CLORE.AI 市场的典型费率:

GPU
显存
价格/天
最适合

RTX 3090

24GB

$0.30–1.00

7-8B 模型

RTX 4090

24GB

$0.50–2.00

7-13B,速度快

A100

40GB

$1.50–3.00

13-34B 模型

A100

80GB

$2.00–4.00

34-70B 模型

价格为美元/天。费率因提供商而异——请查看 CLORE.AI 市场 以获取当前费率。

故障排除

长时间 HTTP 502

  1. 检查 RAM: 服务器必须有 16GB+ RAM

  2. 检查 VRAM: 必须能装下该模型

  3. 模型下载: 首次运行会从 HuggingFace 下载(5-15 分钟)

  4. HF Token: 受限模型需要身份验证

内存不足

模型下载失败

vLLM 与其他方案对比

特性
vLLM
llama.cpp
Ollama

吞吐量

最佳

良好

良好

VRAM 使用量

中等

易用性

中等

中等

容易

启动时间

5-15 分钟

1-2 分钟

30 秒

多 GPU

原生

有限

有限

工具调用

是(v0.7+)

有限

有限

多 LoRA

是(v0.7+)

在以下情况下使用 vLLM:

  • 吞吐量优先

  • 为多个用户提供服务

  • 有足够的 VRAM 和 RAM

  • 生产环境部署

  • 需要工具调用 / 结构化输出

在以下情况下使用 Ollama:

  • 需要快速设置

  • 单个用户

  • 可用资源较少

后续步骤

最后更新于

这有帮助吗?