NVIDIA NVLink Fusion:助定制XPU接入AI工厂基础设施

2026/08/24 23:00阅读量 2

NVIDIA推出NVLink Fusion,通过将定制XPU接入NVLink互联域、MGX机架架构及成熟软件栈,帮助超大规模云厂商和AI原生公司构建半定制AI工厂。该方案在性能、生态成熟度和部署灵活性上提供显著优势,可降低开发风险并加速上市。

事件概述

NVIDIA 发布 NVLink Fusion,用于将定制 XPU 接入 NVIDIA 的 AI 基础设施,使超大规模云厂商和 AI 原生公司能够构建结合专用芯片与规模化平台的半定制 AI 工厂。该方案强调 AI 工厂应作为整体设计,而非单个加速器集合。

核心信息

  • 性能提升:第六代 NVLink 可在 72-XPU 域内提供高带宽低延迟互联。XPU 间端到端延迟仅为基于现成以太网方案的 1/3,数据包速率高 10 倍。NVLink-C2C 可连接 XPU 与 NVIDIA Vera CPU 或其他生态 CPU,能效比 PCIe 接口高 6 倍。
  • 规模扩展:未来 NVLink 路线图将支持最多 1152 个加速器的互联域,并采用共封装光学技术。
  • 系统级成果:相比 NVIDIA B300,采用 72-GPU NVLink scale-up 域的 GB300 NVL72 系统能提供更高的每 GPU 吞吐量和更好的交互性。
  • 生态与制造:NVLink Fusion 获得 Intel、MediaTek、GUC、Annapurna Labs 等合作伙伴支持,采用 NVIDIA MGX 机架架构,制造伙伴可复用现有生产线,例如 QCT 称其基于 Vera Rubin NVL72 的产线自动化投资可直接复用。
  • 基础设施标准化:XPU 与 GPU 系统(如 Vera Rubin NVL72)可共享机架空间、网络、冷却、供电及管理系统,运营商可先推进建设,再按需配置芯片类型。
  • 工厂级验证:参考计算托盘采用 100% 液冷,可在其他托盘运行状态下热插拔维护;NVLink Switch 托盘同样支持持续运行。NVIDIA DSX 参考架构及 Omniverse DSX AI Factory Blueprint 提供数字孪生和开放参考设计,用于吉瓦级 AI 工厂的设施与芯片协同建模。
  • 软件栈:包括 NCCL(分布式负载)、Dynamo 和 NIXL(资源解耦)、Mission Control(集群管理、遥测和调试),支持混合 AI 基础设施协同运行。

值得关注

NVLink Fusion 的核心思路是将定制 XPU 的创新集中于芯片本身,而将网络、机架、制造、软件等复杂环节交给成熟平台,从而降低 XPU 从流片到数据中心部署的门槛。对于超大规模厂商和 AI 原生公司,这意味着更低的工程风险和更快的上市时间,同时保留对芯片架构的自主选择权。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。