vLLM
在 Clore.ai GPU 上使用 vLLM 进行高吞吐量 LLM 推理
适用于 CLORE.AI GPU 上生产工作负载的高吞吐量 LLM 推理服务器。
所有示例都可以在通过以下方式租用的 GPU 服务器上运行 CLORE.AI 市场.
服务器要求
内存
16GB
32GB+
显存
16GB(7B)
24GB+
网络
500Mbps
1Gbps+
启动时间
5-15 分钟
-
重要: vLLM 需要较大的 RAM 和 VRAM。低于 16GB RAM 的服务器甚至无法运行 7B 模型。
启动时间: 首次启动会从 HuggingFace 下载模型(视模型大小和网络速度而定,需 5-15 分钟)。此期间出现 HTTP 502 属于正常现象。
为什么选择 vLLM?
最高吞吐量 - PagedAttention 带来 24 倍更高的吞吐量
可直接用于生产 - 开箱即用的 OpenAI 兼容 API
持续批处理 - 高效的多用户服务
流式输出 - 实时生成 token
多 GPU - 面向大模型的张量并行
多 LoRA - 可同时提供多个微调适配器(v0.7+)
结构化输出 - JSON Schema 约束和工具调用(v0.7+)
在 CLORE.AI 上快速部署
Docker 镜像:
端口:
命令:
验证是否正常工作
部署后,找到你的 http_pub URL,在 我的订单:
如果超过 15 分钟仍然返回 HTTP 502,请检查:
服务器是否有 16GB+ RAM
服务器是否有足够的 VRAM 供该模型使用
是否已为受限模型设置 HuggingFace token
访问你的服务
在 CLORE.AI 上部署后,可通过以下方式访问 vLLM: http_pub URL:
安装
使用 Docker(推荐)
使用 pip
支持的模型
Mistral 7B
7B
14GB
16GB+
Llama 3.1 8B
8B
16GB
16GB+
Llama 3.1 70B
70B
140GB(或 2x80GB)
64GB+
Mixtral 8x7B
47B
90GB
32GB+
Qwen2.5 7B
7B
14GB
16GB+
Qwen2.5 72B
72B
145GB
64GB+
DeepSeek-V3
236B MoE
多 GPU
128GB+
DeepSeek-R1-Distill-Qwen-7B
7B
14GB
16GB+
DeepSeek-R1-Distill-Qwen-32B
32B
64GB
32GB+
DeepSeek-R1-Distill-Llama-70B
70B
140GB
64GB+
Phi-4
14B
28GB
32GB+
Gemma 2 9B
9B
18GB
16GB+
CodeLlama 34B
34B
68GB
32GB+
服务器选项
基础服务器
生产服务器
使用量化(更低 VRAM)
结构化输出和工具调用(v0.7+)
启用自动工具选择和结构化 JSON 输出:
在 Python 中使用:
通过 response format 输出结构化 JSON:
多 LoRA 服务(v0.7+)
同时使用多个 LoRA 适配器为一个基础模型提供服务:
按模型名称查询特定的 LoRA 适配器:
DeepSeek-R1 支持(v0.7+)
vLLM v0.7+ 原生支持 DeepSeek-R1 蒸馏模型。这些推理模型会生成 <think> 标签,展示它们的推理过程。
DeepSeek-R1-Distill-Qwen-7B(单 GPU)
DeepSeek-R1-Distill-Qwen-32B(双 GPU)
DeepSeek-R1-Distill-Llama-70B(四 GPU)
查询 DeepSeek-R1
解析 think 标签:
API 用法
聊天补全(OpenAI 兼容)
流式输出
cURL
文本补全
完整 API 参考
vLLM 提供 OpenAI 兼容端点,以及额外的实用端点。
标准端点
/v1/models
GET
列出可用模型
/v1/chat/completions
POST
聊天补全
/v1/completions
POST
文本补全
/health
GET
健康检查(可能返回空)
附加端点
/tokenize
POST
将文本分词
/detokenize
POST
将 token 转换为文本
/version
GET
获取 vLLM 版本
/docs
GET
Swagger UI 文档
/metrics
GET
Prometheus 指标
文本分词
在发送请求前用于统计 token 数量:
响应:
反分词
将 token ID 转回文本:
响应:
获取版本
响应:
Swagger 文档
在浏览器中打开以查看交互式 API 文档:
Prometheus 指标
用于监控:
基准测试
吞吐量(每用户 tokens/秒)
Mistral 7B
100
170
210
230
Llama 3.1 8B
95
150
200
220
Llama 3.1 8B(AWQ)
130
190
260
280
Mixtral 8x7B
-
45
70
85
Llama 3.1 70B
-
-
25(2x)
45(2x)
DeepSeek-R1 7B
90
145
190
210
DeepSeek-R1 32B
-
-
40
70(2x)
基准测试更新于 2026 年 1 月。
上下文长度与 VRAM
8B FP16
18GB
22GB
30GB
46GB
8B AWQ
8GB
10GB
14GB
22GB
70B FP16
145GB
160GB
190GB
250GB
70B AWQ
42GB
50GB
66GB
98GB
Hugging Face 身份验证
适用于受限模型(Llama 等):
或者设置为环境变量:
GPU 要求
7-8B
16GB
16GB
24GB VRAM,32GB RAM
13B
26GB
32GB
40GB VRAM
34B
70GB
32GB
80GB VRAM
70B
140GB
64GB
2x80GB
成本估算
CLORE.AI 市场的典型费率:
RTX 3090
24GB
$0.30–1.00
7-8B 模型
RTX 4090
24GB
$0.50–2.00
7-13B,速度快
A100
40GB
$1.50–3.00
13-34B 模型
A100
80GB
$2.00–4.00
34-70B 模型
价格为美元/天。费率因提供商而异——请查看 CLORE.AI 市场 以获取当前费率。
故障排除
长时间 HTTP 502
检查 RAM: 服务器必须有 16GB+ RAM
检查 VRAM: 必须能装下该模型
模型下载: 首次运行会从 HuggingFace 下载(5-15 分钟)
HF Token: 受限模型需要身份验证
内存不足
模型下载失败
vLLM 与其他方案对比
吞吐量
最佳
良好
良好
VRAM 使用量
高
低
中等
易用性
中等
中等
容易
启动时间
5-15 分钟
1-2 分钟
30 秒
多 GPU
原生
有限
有限
工具调用
是(v0.7+)
有限
有限
多 LoRA
是(v0.7+)
否
否
在以下情况下使用 vLLM:
吞吐量优先
为多个用户提供服务
有足够的 VRAM 和 RAM
生产环境部署
需要工具调用 / 结构化输出
在以下情况下使用 Ollama:
需要快速设置
单个用户
可用资源较少
后续步骤
Ollama - 更简单的替代方案,启动更快
DeepSeek-R1 - 推理模型指南
DeepSeek-V3 - 最佳通用模型
Qwen2.5 - 多语言模型
Llama.cpp - 更低 VRAM 选项
最后更新于
这有帮助吗?