超节点:AI算力从“拼单点”到“拼系统”的范式转移
2026/09/17 11:49阅读量 3
随着大模型进入推理主导阶段,AI算力衡量标准已从单卡峰值性能转向系统级有效Token产出能力,推动“超节点”成为产业共识。超节点通过扩展高速互连域(如NVIDIA NVL72实现4.4倍吞吐提升)突破通信、功耗、存储及复杂度四大瓶颈,但面临供应链紧张、生态标准化缺失及可靠性挑战。未来竞争焦点将集中在工程化落地能力与开放协同生态的构建上。
事件概述
2026年,国产算力领域“超节点”概念迅速升温。这标志着AI基础设施竞争逻辑的根本性转变:从追求单芯片峰值性能(FLOPS),转向追求系统在稳定时延下每单位成本产出的有效Token数量。这一转变由大模型参数规模膨胀(MoE架构主流化)及应用侧Agent并发需求激增共同驱动。
核心信息
1. 需求倒逼:从训练到推理的系统性挑战
- 模型侧:前沿模型参数量突破万亿(如DeepSeek R1达671B,Kimi K2.5达1T),MoE架构导致跨卡通信量级剧增。传统服务器集群难以承载高频次的专家路由与Token分发,对互连带宽和时延提出苛刻要求。
- 应用侧:智能体(Agent)兴起使得单次请求触发多轮调用,数据词元消耗量呈百倍增长,进一步放大跨卡通信压力。
- 行业观点:中科曙光高级副总裁李斌指出,算力衡量标准已变为“一套系统能持续输出多少有效算力”,推理作为运营制业务,对时延敏感且成本直接挂钩收入。
2. 技术突破:超节点的效率优势
- 定义:超节点将高速互连域从传统的8卡扩展至几十甚至上百卡,使卡间通信从网络传输级别提升至内存访问级别的低延迟操作。
- 实证对比:SemiAnalysis基准测试显示,在DeepSeek R1推理中,英伟达GB200 NVL72(72卡全互连)单卡吞吐最高达4130 Token/秒,是仅支持8卡互连的HGX B200(941 Token/秒)的4.4倍。效率提升源于互连域扩大对通信开销的压缩,而非单卡算力增强。
3. 落地瓶颈:“四堵墙”与工程化挑战
超节点并非物理组合,需解决以下系统性难题:
- 通信墙:需将高带宽互连域扩展至64卡以上,实现近内存访问延迟。
- 功耗与散热墙:液冷成为标配。联想“海神液冷”支持45度温水进水,PUE低至1.04;生产环境需十万级洁净度以防漏液,工厂需进行承重加固及十兆瓦级供电改造。
- 存储与复杂度墙:中科曙光ParaStor系统优化大规模并发访问;故障快速隔离、跨架构迁移及运维压力随规模放大而加剧。
- 供应链约束:高速线缆、背板等元器件供应紧张;国产AI加速卡受外部制约,IDC预测2026-2027年出货量虽增至368万-608万张,但仍框定放量节奏。
4. 厂商路线与规模分歧
关于一级高速全互联域的最佳规模,业界存在分歧,但共识在于“规模非目的,效率才是关键”:
- 英伟达:控制单一互连域规模,避免边际收益递减带来的复杂度与成本增加。
- 联想:选择单节点40张GPU(问天超节点),平衡通信效率与可靠性/运维挑战,通过标准网络扩展至更大集群。
- 中科曙光:采取“大小通吃”策略,既有十万卡AI超集群(曙光8000),也有40卡箱式超节点(scaleX40)。
- 警示:部分厂商刻意夸大互连域规模,客户应关注真实负载下的Token成本控制。
5. 生态与未来展望
- 标准化与开放:为解决互不兼容导致的迁移成本高企,厂商纷纷布局开放架构。浪潮信息推出10款开放加速系统并牵头创新联合体;曙光推动“AI计算开放架构”分层解耦;联想坚持通用超节点开放路线与定制化深度协同并行。
- 客户分层:头部互联网企业具备系统工程能力率先部署;中小企业及科研机构更依赖开箱即用、封装复杂度的产品(如联想SuperPod40、曙光scaleX40)。
- 演进方向:
- 形态分层:内部Scale-up追求低时延,之间通过开放Scale-out网络扩展。
- 场景差异化:预训练、后训练、推理等不同阶段匹配专用芯片与互连架构,避免错配。
- 前沿技术储备:800伏高压直流供电、PCIe Gen6交换、整机柜浸没式液冷等。
值得关注
超节点竞赛的终局不在于硬件参数表的堆砌,而在于谁能构建开放、协同、可持续演进的生态,并在工程化层面实现成千上万次稳定复制。真正的竞争始于以“每元每毫秒产出有效Token”为计量单位的系统级较量。
