NVIDIA Vera Rubin正式大规模部署:10倍能效提升,最低Token成本

2026/07/21 23:36阅读量 3

NVIDIA Vera Rubin NVL72平台已进入量产阶段,全球超300家合作伙伴部署。CoreWeave实测显示其每兆瓦Token吞吐量较Grace Blackwell提升10倍;Google Cloud推出A5X实例;DeepInfra验证Vera CPU性能翻倍。该平台通过极致协同设计实现最高性能功耗比和最低推理成本。

事件概述

NVIDIA于2026年7月21日宣布Vera Rubin NVL72平台正式大规模生产,已向CoreWeave、Google Cloud、Microsoft Azure、Oracle Cloud Infrastructure等全球300多家合作伙伴交付机架。该平台采用7芯片5托盘协同设计(Vera CPU、Groq 3 LPX、Spectrum-6 SPX等),从芯片到电网整体优化,目标是实现最高性能功耗比和最低Token成本。

核心数据

  • CoreWeave基准测试(DeepSeek-R1模型):Vera Rubin NVL72每兆瓦吞吐量达Grace Blackwell NVL72的10倍,Token成本降至1/10
  • 网络性能:第六代NVLink扩展网络吞吐量提升2倍,延迟降低3倍;Spectrum-X以太网RDMA带宽比标准以太网高1.6倍。
  • Vera CPU:定制Olympus核心单线程性能提升2倍,核间带宽3倍,内存延迟降低40%,DeepInfra实测支持并发AI Agent数量提升1.6倍。
  • 冷却效率:45°C液冷入口设计实现无冷水机组干冷却,新AI工厂每兆瓦年节省数百万加仑水;无电缆/风扇/软管设计使计算托盘组装时间从小时级缩短至1分钟。

关键部署与合作

合作伙伴具体动作
Microsoft & Mistral在欧洲新建数十亿美元AI基础设施,Mistral引入数千块Vera Rubin GPU,提供主权AI云环境;Mistral Medium 3.5和OCR 4上线Microsoft Foundry。
Google Cloud推出A5X裸金属实例,支持单站点数万块Rubin GPU、多站点近百万GPU集群;伦敦初创公司Ineffable Intelligence首批使用,用于强化学习“超级学习器”训练。
CoreWeave率先验证并商用Vera Rubin NVL72,部署Spectrum-X SN6600-LD液冷交换机,提供无阻塞多平面架构;Jane Street等客户将用于扩展AI工厂。
DeepInfra独立基准测试证明Vera CPU在AI Agent编排速度上翻倍,支持更多并发代理。

值得关注

  • 主权AI:欧洲可通过Microsoft-Mistral-NVIDIA三方合作,在本地控制数据与模型,兼顾创新、经济性与合规。
  • 光子学CPO:NVIDIA Photonics共封装光学交换机进入量产,功耗降低5倍,MTBI提高10倍,首批采用者包括CoreWeave、Lambda、OCI。
  • NVLink Fusion:开放NVLink生态,允许第三方XPU接入,加速合作伙伴产品上市。

本文基于NVIDIA官方博客及合作伙伴公开信息整理。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。