For the complete documentation index, see llms.txt. This page is also available as Markdown.

TensorRT-LLM

借助 NVIDIA TensorRT 优化实现最大 LLM 推理吞吐量——通过 Triton Inference Server 部署

TensorRT-LLM 是 NVIDIA 的开源库,用于优化 NVIDIA GPU 上的大语言模型推理。它通过算子融合、量化(INT4、INT8、FP8)、动态批处理和分页 KV 缓存,提供业界领先的性能。与 Triton Inference Server 结合后,你将获得生产级的服务基础设施。

GitHub: NVIDIA/TensorRT-LLM — 1万+ ⭐


为什么选择 TensorRT-LLM?

功能
vLLM
TensorRT-LLM

吞吐量

优秀

一流

延迟

优秀

INT4/INT8 量化

部分

原生

FP8 支持

有限

完整

多 GPU 张量并行

设置复杂度

中-高


前提条件

  • 带 GPU 租赁的 Clore.ai 账户

  • 采用 Ampere 架构或更新架构的 NVIDIA GPU (RTX 3090、A100、RTX 4090、H100)

  • 具备基础的 Linux 和 Docker 知识

  • 为你所选模型提供足够的 VRAM


各模型的 VRAM 要求

模型
FP16
INT8
INT4

Llama-3.1 8B

16GB

8GB

4GB

Llama-3.1 70B

140GB

70GB

35GB

Mistral 7B

14GB

7GB

4GB

Mixtral 8x7B

90GB

45GB

24GB

Qwen2.5 72B

144GB

72GB

36GB


步骤 1 — 在 Clore.ai 上选择你的 GPU

  1. 登录到 clore.ai市场

  2. 用于单 GPU 服务(7B–13B 模型): RTX 4090 24GB 或 RTX 3090 24GB

  3. 用于大模型(70B+): 多块 A100 80GB 或 H100

多 GPU 策略:

  • 2x A100 80GB → FP16 版 Llama 3.1 70B 或 Qwen2.5 72B

  • 4x A100 80GB → INT8 版 Llama 3.1 405B

  • 在 Clore.ai 市场中选择列出了多块 GPU 的服务器


步骤 2 — 使用 TRT-LLM 后端部署 Triton Inference Server

Docker 镜像:

暴露端口:

环境变量:

卷/磁盘: 建议至少 100GB


步骤 3 — 连接并验证安装


步骤 4 — 下载并准备模型

我们将以 Llama 3.1 8B 为例。请根据你选择的模型调整路径。

安装 HuggingFace CLI

下载模型权重


步骤 5 — 构建 TensorRT 引擎

这是关键步骤——将模型编译为优化后的 TensorRT 引擎。

FP16 引擎(最佳质量)

INT8 SmoothQuant 引擎(更高吞吐量)

INT4 AWQ 引擎(最高吞吐量 / 最低内存)

引擎构建时间: 根据 GPU 和模型大小而定,约 10–30 分钟。这是一次性操作——一旦构建完成,加载引擎只需几秒。


步骤 6 — 使用 TRT-LLM Python API 进行快速测试

在设置 Triton 之前,请先验证引擎是否可用:


步骤 7 — 设置 Triton Inference Server

创建模型仓库结构

创建引擎符号链接

启动 Triton Server


步骤 8 — 查询 API

兼容 OpenAI 的客户端

基准测试吞吐量


步骤 9 — 添加兼容 OpenAI 的 API 封装

为了更方便集成,请添加一个 FastAPI 封装:


故障排查

引擎构建 OOM

Triton Server 未启动

吞吐量较低


Clore.ai GPU 上的性能基准

模型
GPU
量化
吞吐量(tokens/秒)

Llama 3.1 8B

RTX 4090

FP16

~3,500

Llama 3.1 8B

RTX 4090

INT4 AWQ

~6,200

Llama 3.1 70B

2x A100 80G

FP16

~1,800

Mixtral 8x7B

2x RTX 4090

INT8

~2,400


更多资源


在 Clore.ai 上使用 TensorRT-LLM 是生产级 LLM 服务的最佳选择,尤其适用于吞吐量和延迟至关重要的场景。对于更简单的部署,可以考虑 vLLM 指南。


Clore.ai GPU 推荐

使用场景
推荐 GPU
Clore.ai 预计成本

开发/测试

RTX 3090(24GB)

$0.07–0.21/gpu/hr

生产推理

RTX 4090(24GB)

$0.14–0.42/gpu/hr

大模型(70B+)

A100 80GB

💡 本指南中的所有示例都可以部署在 Clore.ai GPU 服务器上。浏览可用 GPU 并按小时租用——无需承诺,拥有完整 root 访问权限。

最后更新于

这有帮助吗?