TensorRT-LLM
借助 NVIDIA TensorRT 优化实现最大 LLM 推理吞吐量——通过 Triton Inference Server 部署
TensorRT-LLM 是 NVIDIA 的开源库,用于优化 NVIDIA GPU 上的大语言模型推理。它通过算子融合、量化(INT4、INT8、FP8)、动态批处理和分页 KV 缓存,提供业界领先的性能。与 Triton Inference Server 结合后,你将获得生产级的服务基础设施。
GitHub: NVIDIA/TensorRT-LLM — 1万+ ⭐
为什么选择 TensorRT-LLM?
吞吐量
优秀
一流
延迟
好
优秀
INT4/INT8 量化
部分
原生
FP8 支持
有限
完整
多 GPU 张量并行
是
是
设置复杂度
低
中-高
TensorRT-LLM 通常可提供 2–4 倍更高的吞吐量 相比标准 HuggingFace transformers 推理,在批量服务场景下也比 vLLM 提供高 30–50% 的吞吐量。
前提条件
带 GPU 租赁的 Clore.ai 账户
采用 Ampere 架构或更新架构的 NVIDIA GPU (RTX 3090、A100、RTX 4090、H100)
具备基础的 Linux 和 Docker 知识
为你所选模型提供足够的 VRAM
各模型的 VRAM 要求
Llama-3.1 8B
16GB
8GB
4GB
Llama-3.1 70B
140GB
70GB
35GB
Mistral 7B
14GB
7GB
4GB
Mixtral 8x7B
90GB
45GB
24GB
Qwen2.5 72B
144GB
72GB
36GB
步骤 1 — 在 Clore.ai 上选择你的 GPU
登录到 clore.ai → 市场
用于单 GPU 服务(7B–13B 模型): RTX 4090 24GB 或 RTX 3090 24GB
用于大模型(70B+): 多块 A100 80GB 或 H100
步骤 2 — 使用 TRT-LLM 后端部署 Triton Inference Server
Docker 镜像:
使用 -trtllm-python-py3 变体——其中已预装 TensorRT-LLM 后端。该标签对应 NVIDIA 容器发布版本(24.01 = 2024 年 1 月)。查看 NGC 以获取最新标签。
暴露端口:
环境变量:
卷/磁盘: 建议至少 100GB
步骤 3 — 连接并验证安装
步骤 4 — 下载并准备模型
我们将以 Llama 3.1 8B 为例。请根据你选择的模型调整路径。
安装 HuggingFace CLI
下载模型权重
步骤 5 — 构建 TensorRT 引擎
这是关键步骤——将模型编译为优化后的 TensorRT 引擎。
FP16 引擎(最佳质量)
INT8 SmoothQuant 引擎(更高吞吐量)
INT4 AWQ 引擎(最高吞吐量 / 最低内存)
步骤 6 — 使用 TRT-LLM Python API 进行快速测试
在设置 Triton 之前,请先验证引擎是否可用:
步骤 7 — 设置 Triton Inference Server
创建模型仓库结构
创建引擎符号链接
启动 Triton Server
步骤 8 — 查询 API
兼容 OpenAI 的客户端
基准测试吞吐量
步骤 9 — 添加兼容 OpenAI 的 API 封装
为了更方便集成,请添加一个 FastAPI 封装:
故障排查
引擎构建 OOM
Triton Server 未启动
吞吐量较低
Clore.ai GPU 上的性能基准
Llama 3.1 8B
RTX 4090
FP16
~3,500
Llama 3.1 8B
RTX 4090
INT4 AWQ
~6,200
Llama 3.1 70B
2x A100 80G
FP16
~1,800
Mixtral 8x7B
2x RTX 4090
INT8
~2,400
更多资源
在 Clore.ai 上使用 TensorRT-LLM 是生产级 LLM 服务的最佳选择,尤其适用于吞吐量和延迟至关重要的场景。对于更简单的部署,可以考虑 vLLM 指南。
Clore.ai GPU 推荐
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
💡 本指南中的所有示例都可以部署在 Clore.ai GPU 服务器上。浏览可用 GPU 并按小时租用——无需承诺,拥有完整 root 访问权限。
最后更新于
这有帮助吗?