英伟达Vera Rubin架构解析:异构分工驱动Agent推理吞吐提升30倍
2026/08/26 15:46阅读量 2
在Hot Chips 2026上,英伟达披露了Vera Rubin NVL72针对Agent工作负载的性能测试结果,在DeepSeek V4-Pro模型及160 Token/s交互速度下,每兆瓦吞吐较GB300最高提升30倍。这一突破并非仅依赖GPU算力升级,而是通过引入Groq 3 LPX专用芯片、Vera CPU及Spectrum-X网络构建的异构系统架构实现。该架构将长上下文处理、低延迟Token生成、工具编排及数据交互拆分至不同处理器,标志着AI基础设施优化重心从单一芯片向全链路协同转变。
事件概述
在Hot Chips 2026期间,英伟达发布了Vera Rubin NVL72平台针对智能体(Agent)推理工作负载的最新测试数据。基于SemiAnalysis AgentX真实流量轨迹模拟,在DeepSeek V4-Pro模型、单用户每秒160 Token的交互条件下,Vera Rubin NVL72相比前代GB300 NVL72实现了最高30倍的每兆瓦吞吐量提升。这一性能跃升的核心在于英伟达不再单纯依赖GPU算力的堆叠,而是通过异构计算架构重新划分了Agent任务中的计算边界。
核心信息
1. 测试基准与长上下文挑战
- 测试环境:采用SemiAnalysis AgentX工作负载,保留真实Agent编程会话的请求长度、上下文增长、工具暂停等特征,中位输入上下文超过14万Token。
- 性能指标:同时监测“单个用户每秒获得的Token数量”(交互速度)和“固定电力预算下的系统总Token处理能力”(每兆瓦吞吐)。
- 背景差异:传统推理基准多针对静态Prompt设计,而Agent任务具有递归式、多轮操作特点,Prefill阶段的上下文随迭代持续增长,对基础设施的动态负载适应能力提出更高要求。
2. 异构分工架构详解
英伟达将Agent推理拆解为不同类型的计算任务,由不同硬件组件协同完成:
- Vera Rubin GPU:承担大规模模型计算,负责处理输入上下文并生成KV Cache,或执行Attention计算。作为通用计算核心,提供灵活的吞吐能力。
- Groq 3 LPX (Low Power Accelerator):专攻低延迟Token生成(Decode阶段)。在Gemma 4 31B、10万Token上下文负载下,输出速度达每秒3400个Token,响应速度约为替代方案的4倍。LPX不替代GPU,而是针对内存带宽和单步延迟瓶颈进行补位,支持推测解码等灵活分工模式。
- Vera CPU:处理模型调用之外的逻辑任务,包括工具编排、代码执行、数据处理及模拟。解决Agent在多轮推理间因工具调用产生的CPU负载增加问题。
- Spectrum-X 网络:连接上述计算、数据和存储资源,确保异构组件间的高效通信。
3. 基础设施扩展:Scale-In与Multiplane
随着Agent任务链条延长,瓶颈延伸至模型调用之外,英伟达提出了新的网络优化方向:
- Scale-In:针对数据中心南北向基础设施流量,由BlueField-4和DOCA承担网络、存储访问、安全及控制平面任务,解决计算系统与外部数据源/存储服务之间的连接效率问题。
- Spectrum-X Multiplane:解决超大规模集群的网络扩展与故障恢复。通过多独立网络平面扩大规模,支持最高51.2万张GPU扩展;在八平面拓扑中,单平面失效后可维持约90%总带宽,硬件级重路由使故障恢复速度比软件方案快11倍。
值得关注
- 架构范式转变:Agent工作负载促使AI基础设施从“单一芯片性能竞赛”转向“全链路协同优化”。决定任务效率的关键因素已从单纯的模型计算时间,扩展到上下文管理、Token生成延迟、工具执行效率及数据通信速度。
- GPU地位未变但角色细化:GPU仍是AI计算核心,但其任务边界更加明确。专用加速器(如LPX)和CPU分别接管特定瓶颈环节,形成更精细的异构分工体系。
- 市场适用性:当前展示的是面向高并发、长上下文的大规模部署上限设计。实际市场渗透率将取决于Agent应用产生的真实负载规模,以及复杂异构系统带来的性能收益是否足以抵消其成本复杂性。
