超节点绕行英伟达:国产算力从单卡比拼转向系统级竞赛

2026/08/16 21:18阅读量 2

Kimi K3 将 64 卡及以上超节点设为部署硬门槛,阿里云等算力供给方随后上线对应实例,显示大模型对超节点的需求正在成为主流。国产算力厂商绕开单卡和 CUDA 生态短板,从超大规模集群、光互连和低成本小型化三条路线重新定义算力供给,华为称昇腾950超节点整体性能达到 GB200 NVL72 的1.7倍。这场竞争的关键不再是单卡性能,而是系统级效率。

事件概述

  • Kimi K3 的技术报告和官方部署文档明确推荐在 64 卡及以上超节点中部署,这是超节点首次成为大模型部署的硬性门槛。K3 拥有 2.8 万亿参数、896 个专家,MoE 架构下跨节点通信量极大,离开超节点推理效率无法达到应有水平。
  • 随后阿里云真武 M890 超节点实例上线,Kimi K3 和通义千问 3.8 Max 均已开始运行,供给端与需求端正在互相拉动。

为什么转向超节点

  • SemiAnalysis 估算,单颗国产 AI 芯片性能约为英伟达 Blackwell 的三分之一,先进制程受限短期内难以解决。
  • 大模型参数向数万亿级增长,MoE 架构下每生成一个 token,大量 GPU 都需要同步参数、交换数据;传统 8 卡服务器加卡越多,通信等待越长,算力利用率反而下降。
  • 算力每两年翻三倍,内存带宽只增长 1.6 倍,互连带宽只增长 1.4 倍,数据供给和传输成为瓶颈。超节点用高速互联把成百上千颗芯片组合成逻辑统一的算力集群。
  • 华为内部测算,单颗昇腾不如英伟达,但昇腾950超节点整体性能达到 GB200 NVL72 的 1.7 倍。
  • 英伟达的护城河是 CUDA 生态和单卡生态,超节点比拼的是集群调度、互联效率和系统稳定性,英伟达在这个层面并没有几十年的先发优势。

三条技术路线

  • 往大做,靠规模碾压:华为昇腾950超节点做到 1024 卡,满配可扩展到 8192 卡,是业内目前最大规模;中科曙光曙光8000 十万卡集群落地郑州国家超算互联网核心节点,上线即满载。曙光8000 采用原生超智融合设计,从 FP64 科学计算到 INT8 推理都能在同一套系统上运行,既可用于大模型训练,也可用于气象预报、基因测序。中科曙光高级副总裁李斌表示,从万卡到十万卡,乘以 10 本身不难,难的是性能能否同步乘以 10,任何环节的短板都会造成性能折损。
  • 往底层做,换传输介质:壁仞推出 NPO 光互连方案,用光信号替代铜线,单个超节点可扩展到 1024 卡。铜缆电信号超过 3 米就开始严重衰减,现有方案最多支持 128 张 GPU。英伟达也面临同样限制,在 2026 年 GTC 上表示要用光互连把系统从 NVL72 扩展到 NVL576。壁仞还把 GPU 节点和交换机节点物理分开,用光纤灵活互连。
  • 往便宜做,降低门槛:中兴 OEX 走开放解耦路线,兼容多家芯片,客户可自行搭配。中科曙光 scaleX40 是全球首个无线缆箱式超节点,40 卡标准 19 英寸箱式设计,部署时间从小时级压缩到分钟级,可直接放入现有机房。40 卡被认为是性能和成本的平衡点,是大多数企业用得起的量级。中科曙光同时押注十万卡天花板和 40 卡入门级市场。

值得关注

  • 英伟达的路径是先迭代 GPU 架构,再升级 NVLink 互联,最后用 NVL72 形态把芯片和互联打包成完整超节点;国产算力则先做超节点系统方案,再倒逼每颗芯片的设计。制程暂时追不上,就在系统层面重新定义规则。
  • 英伟达被挑战,不是因为有人在单卡上超过它,而是因为有人从系统层面重新定义了算力供给方式。国产算力正在英伟达尚未建立绝对优势的领域抢先布局。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。