NVIDIA Vera Rubin NVL72在MLPerf Inference v6.1中刷新性能纪录,吞吐量较GB300提升最高3.7倍
2026/09/16 23:00阅读量 3
NVIDIA Vera Rubin NVL72系统在MLPerf Inference v6.1基准测试中首次亮相,针对Qwen3-VL和DeepSeek-R1模型展现出显著的性能优势,吞吐量较上一代GB300 NVL72系统最高提升3.7倍。同时,GB300 NVL72在扩展至288个GPU时实现了99%的线性缩放效率,且通过软件优化使部分场景性能较v6.0版本提升达1.6倍。这些结果验证了硬件架构、互联技术与软件栈协同设计在提升AI推理经济性和规模化部署中的关键作用。
事件概述
NVIDIA在MLPerf Inference v6.1基准测试中提交了Vera Rubin NVL72系统的预览结果,展示了其在大规模AI推理工作负载下的领先性能。此次提交涵盖了从边缘设备到大型数据中心的全栈解决方案,强调了平台互操作性、扩展效率和持续软件优化对降低推理成本的重要性。
核心性能数据
1. Vera Rubin NVL72 性能突破
- Qwen3-VL模型:在离线(offline)、服务器(server)和交互式(interactive)场景中,使用vLLM结合NVIDIA Dynamo开源推理框架,Vera Rubin NVL72的吞吐量比GB300 NVL72最高提升3.7倍。
- DeepSeek-R1模型:使用NVIDIA TensorRT-LLM库,吞吐量比GB300 NVL72最高提升2.5倍。
- AgentX基准测试:在SemiAnalysis AgentX基准测试中,Vera Rubin NVL72的表现比GB300 NVL72高出30倍,反映了AI智能体(Agentic AI)对推理性能测量的新需求。
2. GB300 NVL72 扩展效率
- 线性缩放能力:在DeepSeek-R1(DSR1)的离线场景中,将系统从单机架(72个GPU)扩展至四机架(288个GPU),实现了99%的缩放效率,吞吐量随硬件增加几乎呈线性增长。
- 视频生成性能:在WAN 2.2文本转视频基准测试中,达到每秒0.65个720p视频的处理速度,相比单节点吞吐量提升9倍,延迟降低7.5倍。
3. 软件优化增益
- 版本迭代提升:GB300 NVL72在Qwen3-VL上的性能较MLPerf v6.0版本最高提升1.6倍。主要优化手段包括降低KV缓存精度、内核融合、改进内核以及采用vLLM和NVIDIA Dynamo进行解耦服务(disaggregated serving)。
- 持续优化:截至提交截止日后,未经验证的GPT-OSS-120B和DLRMv3模型测试结果也显示出进一步的性能提升。
技术架构与生态
- 硬件协同设计:Vera Rubin增强了Tensor Cores和Transformer Engine,加速预填充(prefill)和解码(decode)阶段;NVFP4精度降低了模型权重、注意力机制和KV缓存的内存占用。第六代NVIDIA NVLink和NVLink Switch提供了10倍更高的包速率和3倍更低的延迟,为机架级扩展提供基础互联支持。
- 合作伙伴参与:Nebius等合作伙伴也提交了Vera Rubin NVL72的预览结果。此外,Jetson AGX Thor在Edge-Agentic基准测试中表现优异。共有19家合作伙伴参与了MLPerf Inference v6.1的提交,包括ASUS、Azure、Cisco、Dell Technologies、HPE、Supermicro等,其中8家基于多节点Blackwell NVL72系统。
行业影响
此次基准测试结果凸显了AI基础设施决策中三个关键杠杆:系统性能(决定每单位时间的Token生成量和收入)、扩展效率(确保硬件增加带来成比例的吞吐量增长)和软件优化速度(最大化基础设施投资回报)。随着MLPerf即将推出Endpoints基准测试以标准化智能体推理工作负载的测量,AI推理的经济性和规模化能力将成为竞争焦点。
