NVIDIA Vera Rubin NVL72能效实测:智能体负载每兆瓦吞吐量提升30倍,token成本降35倍
2026/08/24 23:00阅读量 2
NVIDIA公布基于SemiAnalysis AgentX真实智能体编码轨迹的实测数据,称Vera Rubin NVL72在智能体推理负载下每兆瓦吞吐量最高可达GB300 NVL72的30倍,每百万token成本降低35倍。该结果尚未经SemiAnalysis正式评审,体现出从芯片、互联到软件堆栈的深度协同设计带来的性能跃升。
事件概述
NVIDIA发布基于真实智能体编码会话的推理性能实测,展示其下一代AI工厂平台Vera Rubin NVL72在智能体负载下的能效与成本优势。测试采用SemiAnalysis AgentX工作负载,包含真实上下文增长、工具调用与子智能体生成过程。
核心数据
- 相比GB300 NVL72,Vera Rubin NVL72在智能体工作负载下每兆瓦吞吐量最高提升30倍,每百万token成本降低35倍。
- 对电力受限的AI工厂而言,同等能耗下可完成约30倍智能体任务,token成本下降直接改善利润率。
- 该结果基于DeepSeek V4 Pro等模型测得,目前待SemiAnalysis评审;尚未计入Vera CPU工具调用性能。
- 作为参照,GB300 NVL72在DeepSeek V4 Pro上已比Hopper架构每兆瓦吞吐量高15倍。
- 智能体负载token消耗远高于普通聊天,OpenRouter数据显示可达15倍;会话上下文可累积至数十万token,长上下文处理成为关键。
技术基础
Vera Rubin NVL72通过跨芯片、互联、系统与软件的“极端协同设计”实现增益,涉及分离式预填充/解码、大尺度专家并行、分布式KV缓存与KV路由、NVFP4 4-bit量化、第五代Tensor Core及第三代Transformer Engine等。第六代NVLink互联提供10倍包速率和3倍低延迟,软件栈包含TensorRT LLM与Dynamo等服务框架,与硬件协同优化。
值得关注
Vera Rubin已全面生产并在生态中扩展。该实测表明,在电力受限的AI工厂中,推理效率正成为决定收入和利润率的核心因素。
