For the complete documentation index, see llms.txt. This page is also available as Markdown.

Triton Inference Server

NVIDIA Triton 推理服务器 是一个适用于生产级的开源推理服务平台,支持几乎所有主流机器学习框架。Triton 旨在实现高吞吐、低延迟的服务,可处理 PyTorch、TensorFlow、ONNX、TensorRT、OpenVINO 等模型——全部由单个服务器进程提供。将其部署在 Clore.ai 的 GPU 云上,可获得可扩展、成本高效的推理基础设施。


什么是 Triton 推理服务器?

Triton 是 NVIDIA 针对大规模提供 ML 模型服务这一挑战给出的答案:

  • 多框架: PyTorch、TensorFlow、TensorRT、ONNX、OpenVINO、Python 自定义后端

  • 并发执行: 多个模型、每个 GPU 上多个实例

  • 动态批处理: 自动将请求批量处理,以提高吞吐量

  • gRPC + HTTP: 开箱即用的行业标准协议

  • 指标: 兼容 Prometheus 的指标端点

  • 模型仓库: 基于文件系统的模型管理

使用的端口:

端口
协议
用途

8000

HTTP

REST 推理 API

8001

gRPC

gRPC 推理 API

8002

HTTP

Prometheus 指标


前提条件

要求
最低
推荐

GPU 显存

8 GB

16–24 GB

GPU

任何支持 CUDA 11+ 的 NVIDIA 显卡

RTX 4090 / A100

内存

16 GB

32 GB

存储

20 GB

50 GB

Triton 也支持仅 CPU 推理,适用于非 CUDA 工作负载。对于不需要 GPU 的批处理任务,可使用 Docker 镜像的 仅 CPU 版本来节省成本。


第 1 步 — 在 Clore.ai 上租用 GPU

  1. 登录到 clore.ai.

  2. 点击 市场 并按 VRAM ≥ 16 GB 过滤。

  3. 选择一个服务器并点击 配置.

  4. 设置 Docker 镜像: nvcr.io/nvidia/tritonserver:24.01-py3

    • (将 24.01 替换为最新版本 — 请查看 NGC 目录)

  5. 设置开放端口: 22 (SSH)、 8000 (HTTP)、 8001 (gRPC)、 8002 (指标)。

  6. 点击 租用.


第 2 步 — 自定义 Dockerfile(带 SSH)

官方 Triton 镜像不包含 SSH 服务器。请使用此 Dockerfile:


第 3 步 — 了解模型仓库

Triton 从一个 模型仓库 中加载模型——这是一个具有特定结构的目录:

每个模型需要:

  1. 一个以模型名称命名的目录

  2. 一个 config.pbtxt 配置文件

  3. 至少一个版本子目录(例如, 1/)以及模型文件


第 4 步 — 部署 PyTorch 模型

导出模型为 TorchScript

设置模型仓库

创建 config.pbtxt


第 5 步 — 部署 ONNX 模型

导出为 ONNX

ONNX 配置


第 6 步 — 部署 Python 自定义后端

适用于不适合标准后端的模型(自定义预处理、集成逻辑):


第 7 步 — 启动 Triton 并测试

启动 Triton 服务器

检查可用模型

通过 HTTP 运行推理

通过 gRPC 运行推理


使用 Prometheus 监控

Triton 会在 8002 端口暴露指标:

关键指标:


动态批处理配置


故障排查

模型加载失败

解决方案: 检查目录结构和权限:

CUDA 不兼容

解决方案: 让 Triton 镜像版本与你的 CUDA 驱动相匹配:

端口无法访问

解决方案: 确认 Clore.ai 中已转发全部三个端口(8000、8001、8002)。逐个测试:

模型加载期间 OOM

解决方案: 减少实例数量,或对某些模型使用 CPU 实例:


成本估算

GPU
显存
预估价格
吞吐量(ResNet50)

RTX 3080

10 GB

$0.05–0.19/小时

~500 请求/秒

RTX 4090

24 GB

$0.14–0.42/小时

~1500 请求/秒

A100 40GB

40 GB

~3000 请求/秒

H100

80 GB

~$1.04/小时

~8000 请求/秒


有用资源


Clore.ai GPU 推荐

使用场景
推荐 GPU
Clore.ai 预计成本

开发/测试

RTX 3090(24GB)

$0.07–0.21/gpu/hr

生产级推理

RTX 4090(24GB)

$0.14–0.42/gpu/hr

大模型(70B+)

A100 80GB

💡 本指南中的所有示例都可以部署在 Clore.ai GPU 服务器上。浏览可用 GPU 并按小时租用——无需承诺,拥有完整 root 访问权限。

最后更新于

这有帮助吗?