NVIDIA Nemotron 3 Super(120B MoE)
Nemotron 3 Super 是 NVIDIA 的开源 120B 总参数 / 12B 激活的专家混合(MoE)Hybrid Mamba-Transformer 模型,于 2026 年 3 月 11 日发布。专为复杂 智能体式 AI 系统 —— 自主编码、网络安全分诊以及长篇多步骤研究。可实现 5× 更高吞吐量 相比质量相当的稠密模型。
为什么在 Clore.ai 上运行 Nemotron 3 Super?
Nemotron 3 Super 的 MoE 架构意味着每次前向传递只有 12B 参数处于激活状态——因此你能以中型模型的算力成本获得前沿级推理能力。在 Clore.ai 上,你可以租用一块 RTX 5090(32GB)或两块 RTX 4090,并通过完整的 INT4/FP4 量化以生产级速度运行它。
关键数字:
120B 总参数, 12B 激活(Latent MoE)
Hybrid Mamba-Transformer 架构(Nemotron 系列首个带 MTP 层的版本)
100 万 token 上下文窗口
预训练于 NVFP4 —— NVIDIA 原生 FP4 量化
5× 吞吐量 相比可比的稠密模型
NVIDIA Nemotron 开源模型许可证——开放权重,可商用
硬件要求
Clore.ai 市场上未列出多 GPU 的 80GB 级机型。 目前列出的最大配置是 4× RTX PRO 6000 Blackwell(每张 96GB,共 380GB)以及 8–11× RTX 5090(每张 32GB)。A100 / H200 / B200 容量可按 裸机 需求提供。部署前请查看 GPU 价格与可用性 。
FP4(原生)
1× RTX 5090 32GB
$0.25–0.77/小时
最快;原生 NVFP4
INT4
2× RTX 4090 24GB
$0.28–0.84/小时
强力选择
INT8
4× RTX 4090
$0.56–1.68/小时
接近满精度质量
BF16 完整
4× H100 80GB
约 $4.16/小时
训练 / 完整保真度
Clore.ai 上最划算的选择: 2× RTX 5090(可从 $0.50–1.54/小时 起)用于 BF16 全精度推理。
快速开始:vLLM + Nemotron 3 Super
用于多 GPU(2× RTX 4090 的 INT4):
SGLang(替代方案——更快的 MoE 服务)
对于生产级 MoE 吞吐量,SGLang 的 RadixAttention 在 MoE 模型上相比 vLLM 可带来 2–5× 更高吞吐量:
在 Clore.ai 上部署:分步指南
1. 租用 GPU
筛选: RTX 5090 或 RTX 4090 × 2+
按价格排序(在大约三分之一的服务器上,现货价优于按需价,中位数约便宜 13%)
最低:总计 32GB VRAM(FP4);INT8 需要 48GB;BF16 需要 80GB
2. 启动容器
在 Clore.ai 仪表板中,选择 自定义 Docker 并输入:
或者使用一行 SSH 启动命令:
3. 测试 API
智能体用例:多智能体编码流水线
Nemotron 3 Super 专为多智能体工作流打造。以下是一个使用 OpenAI 兼容 API 的最小示例:
基准测试(2026 年 3 月)
HumanEval
92.1%
90.8%
88.4%
MATH-500
89.3%
90.2%
84.7%
SWE-bench Verified
65.2%
61.4%
55.8%
MMLU
88.7%
87.2%
86.1%
吞吐量(tok/s)
1,840
410
890
在 2× H100 80GB 上使用 INT4 量化测得吞吐量。
监控与生产建议
Clore.ai 上生产环境推荐设置:
--max-model-len 32768适用于大多数工作负载(节省 VRAM,覆盖 95% 的请求)--gpu-memory-utilization 0.90(为 MoE 路由开销预留 10% 缓冲)--enable-chunked-prefill用于更长输入时获得更低延迟为批处理工作负载启用现货订单,可节省 30–40% 成本
成本对比
Clore.ai (现货)
2× RTX 5090
~$5.60
Clore.ai (按需)
2× RTX 5090
~$7.00
Azure AI
托管 API
~$15–20
NVIDIA API
托管 API
~$12–18
对于持续性工作负载,在 Clore.ai 上自托管比托管 API 便宜 2–3 倍。
相关指南
vLLM 服务 —— 具有 OpenAI 兼容 API 的生产级 LLM 服务器
SGLang —— 使用 RadixAttention 获得更快的 MoE 吞吐量
DeepSeek V4 —— 即将推出的 1T 参数开源模型
CrewAI —— 使用基于角色的智能体构建多智能体流水线
OpenHands —— 自主软件工程智能体
GPU 对比 —— 为你的工作负载选择合适的 GPU
最后更新:2026 年 3 月 16 日 | 模型发布:2026 年 3 月 11 日 | 许可证:NVIDIA Nemotron Open Model License
最后更新于
这有帮助吗?