浪潮信息发布两款新品:破解智算“能力”与“产能”双重瓶颈
针对AI Agent时代算力需求从“脉冲式”向“长流持续”转变的趋势,浪潮信息在AICC 2026上发布超节点AI服务器元脑SD200 Ultra和多元算力机组元脑HC2000。前者通过128芯片单机部署、统一寻址及超级算子技术突破单节点智能上限;后者利用液冷底座与MCIS软件栈实现多元算力协同,提升Token产能。此举旨在解决前沿模型运行稳定性与大规模推理成本问题,推动算力产业从“提供算力”向“生产智能”转型。
事件概述
随着AI Agent技术的爆发,算力需求发生质变:从单次问答的“脉冲式”调用转变为连续数小时甚至数天的“长流”负载。IDC数据显示,全球AI推理任务量预计至2030年增长4000万亿次,Token消耗复合增长率达4822.6%,而算力供给满足率却呈下降趋势,导致巨大的算力缺口。单纯堆叠同构算力无法应对Prefill(预填充)与Decode(解码)等不同阶段对计算密度、内存带宽及KV Cache访问的差异化需求。
在此背景下,浪潮信息于AICC 2026提出将算力瓶颈拆解为“Capability(能力上限)”与“Capacity(产能规模)”两个维度,并发布相应解决方案以捅破能力天花板、瓦解产能焦虑。
核心信息
1. 突破单节点智能上限:元脑SD200 Ultra
该产品旨在解决大模型“装不下、跑不快、跑不稳”的问题,支持单机部署高达10万亿参数的模型(如Kimi K3等前沿模型)。
- 紧致扩展架构:基于3D Hyper Mesh架构,整机芯片数量增至128颗,显存提升至8TB,扩展存储达64TB,将海量资源压缩于单一物理边界内。
- 通信优化:
- 统一寻址:通过全局编址和虚拟影子设备注册,使128颗芯片显存形成统一地址空间,实现远端资源的直接访问,跳过消息通信与数据搬移。
- 对称直连:利用对称内存技术实现GPU显存直连,由GPU发起通信,缩短路径并降低延迟。All-to-All通信时延降至0.69微秒。
- 超级算子技术:将Attention、FFN、MoE等基础算子融合为计算与通信一体的大算子,算子数量减少至十分之一,显著降低内核启动次数和显存访问开销。运行Kimi K3时,推理性能提升3倍以上,Token生成时延低至5.85毫秒。
- 高稳定性设计:采用铜互联方案替代光电转换,减少长时间运行中的电路故障风险,保障Agent长链路任务的连续性。
2. 提升Token产能效率:元脑HC2000
该产品面向大规模推理场景,核心思路是让不同类型的算力各司其职,通过硬件底座与软件栈协同提升产能。
- 高密液冷硬件底座:
- 采用全液冷设计与高通流供电,单柜供电能力超300千瓦,承载最多256张AI加速卡,算力密度为传统风冷机柜的4倍。
- 升级Directcom 2.0通信架构,柜内聚合带宽达200Tbps,跨柜多平面无损扩展,All-to-All通信性能提升50%以上。
- 多元算力协同(MCIS软件栈):
- 分工协作:Prefill阶段使用大算力芯片匹配高并行特征;Decode阶段选用大容量HBM芯片兼顾容量与带宽;FFN环节采用3D RAM堆叠芯片缩短搬运路径。
- 动态调整:构建测量、分配、监控、调整的完整流程,根据业务负载变化实时优化PD(Prefill/Decode)配比和实例分配。
- KV Cache优化:打通不同类型算力间的点对点数据直传,避免CPU中转;结合冷热分级存储与多级流水并行聚合,使节点内磁盘I/O性能提升32倍。
- 效能成果:在典型Agent任务场景中,同等投资下实现10倍的Token产能提升。
值得关注
浪潮信息强调,“能力”与“产能”并非孤立路线,而是互为因果的螺旋上升关系。前沿模型的突破(Capability)通过工程迭代降低成本,转化为规模化供给(Capacity);而普及后的应用需求又反过来推动更高阶能力的探索。这一逻辑标志着AI算力产业的价值尺度正从单纯的“提供算力”转向“生产智能”,即用户购买算力设施应如同购买家电般便捷,能够直接高效地产出智能结果。
