NVIDIA Vera Rubin正式大规模部署:10倍能效提升,最低Token成本
2026/07/21 23:36阅读量 3
NVIDIA Vera Rubin NVL72平台已进入量产阶段,全球超300家合作伙伴部署。CoreWeave实测显示其每兆瓦Token吞吐量较Grace Blackwell提升10倍;Google Cloud推出A5X实例;DeepInfra验证Vera CPU性能翻倍。该平台通过极致协同设计实现最高性能功耗比和最低推理成本。
事件概述
NVIDIA于2026年7月21日宣布Vera Rubin NVL72平台正式大规模生产,已向CoreWeave、Google Cloud、Microsoft Azure、Oracle Cloud Infrastructure等全球300多家合作伙伴交付机架。该平台采用7芯片5托盘协同设计(Vera CPU、Groq 3 LPX、Spectrum-6 SPX等),从芯片到电网整体优化,目标是实现最高性能功耗比和最低Token成本。
核心数据
- CoreWeave基准测试(DeepSeek-R1模型):Vera Rubin NVL72每兆瓦吞吐量达Grace Blackwell NVL72的10倍,Token成本降至1/10。
- 网络性能:第六代NVLink扩展网络吞吐量提升2倍,延迟降低3倍;Spectrum-X以太网RDMA带宽比标准以太网高1.6倍。
- Vera CPU:定制Olympus核心单线程性能提升2倍,核间带宽3倍,内存延迟降低40%,DeepInfra实测支持并发AI Agent数量提升1.6倍。
- 冷却效率:45°C液冷入口设计实现无冷水机组干冷却,新AI工厂每兆瓦年节省数百万加仑水;无电缆/风扇/软管设计使计算托盘组装时间从小时级缩短至1分钟。
关键部署与合作
| 合作伙伴 | 具体动作 |
|---|---|
| Microsoft & Mistral | 在欧洲新建数十亿美元AI基础设施,Mistral引入数千块Vera Rubin GPU,提供主权AI云环境;Mistral Medium 3.5和OCR 4上线Microsoft Foundry。 |
| Google Cloud | 推出A5X裸金属实例,支持单站点数万块Rubin GPU、多站点近百万GPU集群;伦敦初创公司Ineffable Intelligence首批使用,用于强化学习“超级学习器”训练。 |
| CoreWeave | 率先验证并商用Vera Rubin NVL72,部署Spectrum-X SN6600-LD液冷交换机,提供无阻塞多平面架构;Jane Street等客户将用于扩展AI工厂。 |
| DeepInfra | 独立基准测试证明Vera CPU在AI Agent编排速度上翻倍,支持更多并发代理。 |
值得关注
- 主权AI:欧洲可通过Microsoft-Mistral-NVIDIA三方合作,在本地控制数据与模型,兼顾创新、经济性与合规。
- 光子学CPO:NVIDIA Photonics共封装光学交换机进入量产,功耗降低5倍,MTBI提高10倍,首批采用者包括CoreWeave、Lambda、OCI。
- NVLink Fusion:开放NVLink生态,允许第三方XPU接入,加速合作伙伴产品上市。
本文基于NVIDIA官方博客及合作伙伴公开信息整理。
