NVIDIA NVLink Fusion:助定制XPU接入AI工厂基础设施
2026/08/24 23:00阅读量 2
NVIDIA推出NVLink Fusion,通过将定制XPU接入NVLink互联域、MGX机架架构及成熟软件栈,帮助超大规模云厂商和AI原生公司构建半定制AI工厂。该方案在性能、生态成熟度和部署灵活性上提供显著优势,可降低开发风险并加速上市。
事件概述
NVIDIA 发布 NVLink Fusion,用于将定制 XPU 接入 NVIDIA 的 AI 基础设施,使超大规模云厂商和 AI 原生公司能够构建结合专用芯片与规模化平台的半定制 AI 工厂。该方案强调 AI 工厂应作为整体设计,而非单个加速器集合。
核心信息
- 性能提升:第六代 NVLink 可在 72-XPU 域内提供高带宽低延迟互联。XPU 间端到端延迟仅为基于现成以太网方案的 1/3,数据包速率高 10 倍。NVLink-C2C 可连接 XPU 与 NVIDIA Vera CPU 或其他生态 CPU,能效比 PCIe 接口高 6 倍。
- 规模扩展:未来 NVLink 路线图将支持最多 1152 个加速器的互联域,并采用共封装光学技术。
- 系统级成果:相比 NVIDIA B300,采用 72-GPU NVLink scale-up 域的 GB300 NVL72 系统能提供更高的每 GPU 吞吐量和更好的交互性。
- 生态与制造:NVLink Fusion 获得 Intel、MediaTek、GUC、Annapurna Labs 等合作伙伴支持,采用 NVIDIA MGX 机架架构,制造伙伴可复用现有生产线,例如 QCT 称其基于 Vera Rubin NVL72 的产线自动化投资可直接复用。
- 基础设施标准化:XPU 与 GPU 系统(如 Vera Rubin NVL72)可共享机架空间、网络、冷却、供电及管理系统,运营商可先推进建设,再按需配置芯片类型。
- 工厂级验证:参考计算托盘采用 100% 液冷,可在其他托盘运行状态下热插拔维护;NVLink Switch 托盘同样支持持续运行。NVIDIA DSX 参考架构及 Omniverse DSX AI Factory Blueprint 提供数字孪生和开放参考设计,用于吉瓦级 AI 工厂的设施与芯片协同建模。
- 软件栈:包括 NCCL(分布式负载)、Dynamo 和 NIXL(资源解耦)、Mission Control(集群管理、遥测和调试),支持混合 AI 基础设施协同运行。
值得关注
NVLink Fusion 的核心思路是将定制 XPU 的创新集中于芯片本身,而将网络、机架、制造、软件等复杂环节交给成熟平台,从而降低 XPU 从流片到数据中心部署的门槛。对于超大规模厂商和 AI 原生公司,这意味着更低的工程风险和更快的上市时间,同时保留对芯片架构的自主选择权。
