For the complete documentation index, see llms.txt. This page is also available as Markdown.

NVIDIA Nemotron 3 Super(120B MoE)

Nemotron 3 Super 是 NVIDIA 的开源 120B 总参数 / 12B 激活的专家混合(MoE)Hybrid Mamba-Transformer 模型,于 2026 年 3 月 11 日发布。专为复杂 智能体式 AI 系统 —— 自主编码、网络安全分诊以及长篇多步骤研究。可实现 5× 更高吞吐量 相比质量相当的稠密模型。

为什么在 Clore.ai 上运行 Nemotron 3 Super?

Nemotron 3 Super 的 MoE 架构意味着每次前向传递只有 12B 参数处于激活状态——因此你能以中型模型的算力成本获得前沿级推理能力。在 Clore.ai 上,你可以租用一块 RTX 5090(32GB)或两块 RTX 4090,并通过完整的 INT4/FP4 量化以生产级速度运行它。

关键数字:

  • 120B 总参数, 12B 激活(Latent MoE)

  • Hybrid Mamba-Transformer 架构(Nemotron 系列首个带 MTP 层的版本)

  • 100 万 token 上下文窗口

  • 预训练于 NVFP4 —— NVIDIA 原生 FP4 量化

  • 5× 吞吐量 相比可比的稠密模型

  • NVIDIA Nemotron 开源模型许可证——开放权重,可商用

硬件要求

配置
显存
Clore.ai 成本
备注

FP4(原生)

1× RTX 5090 32GB

$0.25–0.77/小时

最快;原生 NVFP4

INT4

2× RTX 4090 24GB

$0.28–0.84/小时

强力选择

INT4

1× A100 80GB

完整 INT4,单 GPU

INT8

4× RTX 4090

$0.56–1.68/小时

接近满精度质量

BF16 完整

4× H100 80GB

约 $4.16/小时

训练 / 完整保真度

Clore.ai 上最划算的选择: 2× RTX 5090(可从 $0.50–1.54/小时 起)用于 BF16 全精度推理。

快速开始:vLLM + Nemotron 3 Super

用于多 GPU(2× RTX 4090 的 INT4):

SGLang(替代方案——更快的 MoE 服务)

对于生产级 MoE 吞吐量,SGLang 的 RadixAttention 在 MoE 模型上相比 vLLM 可带来 2–5× 更高吞吐量:

在 Clore.ai 上部署:分步指南

1. 租用 GPU

前往 clore.ai/marketplace:

  • 筛选: RTX 5090RTX 4090 × 2+

  • 按价格排序(在大约三分之一的服务器上,现货价优于按需价,中位数约便宜 13%)

  • 最低:总计 32GB VRAM(FP4);INT8 需要 48GB;BF16 需要 80GB

2. 启动容器

在 Clore.ai 仪表板中,选择 自定义 Docker 并输入:

或者使用一行 SSH 启动命令:

3. 测试 API

智能体用例:多智能体编码流水线

Nemotron 3 Super 专为多智能体工作流打造。以下是一个使用 OpenAI 兼容 API 的最小示例:

基准测试(2026 年 3 月)

基准
Nemotron 3 Super
DeepSeek V3
Llama 4 Maverick

HumanEval

92.1%

90.8%

88.4%

MATH-500

89.3%

90.2%

84.7%

SWE-bench Verified

65.2%

61.4%

55.8%

MMLU

88.7%

87.2%

86.1%

吞吐量(tok/s)

1,840

410

890

在 2× H100 80GB 上使用 INT4 量化测得吞吐量。

监控与生产建议

Clore.ai 上生产环境推荐设置:

  • --max-model-len 32768 适用于大多数工作负载(节省 VRAM,覆盖 95% 的请求)

  • --gpu-memory-utilization 0.90 (为 MoE 路由开销预留 10% 缓冲)

  • --enable-chunked-prefill 用于更长输入时获得更低延迟

  • 为批处理工作负载启用现货订单,可节省 30–40% 成本

成本对比

提供程序
配置
$/小时

Clore.ai (现货)

2× RTX 5090

~$5.60

Clore.ai (按需)

2× RTX 5090

~$7.00

Azure AI

托管 API

~$15–20

NVIDIA API

托管 API

~$12–18

对于持续性工作负载,在 Clore.ai 上自托管比托管 API 便宜 2–3 倍。

相关指南

  • vLLM 服务 —— 具有 OpenAI 兼容 API 的生产级 LLM 服务器

  • SGLang —— 使用 RadixAttention 获得更快的 MoE 吞吐量

  • DeepSeek V4 —— 即将推出的 1T 参数开源模型

  • CrewAI —— 使用基于角色的智能体构建多智能体流水线

  • OpenHands —— 自主软件工程智能体

  • GPU 对比 —— 为你的工作负载选择合适的 GPU


最后更新:2026 年 3 月 16 日 | 模型发布:2026 年 3 月 11 日 | 许可证:NVIDIA Nemotron Open Model License

最后更新于

这有帮助吗?