浪潮信息发布两款新品:破解智算“能力”与“产能”双重瓶颈

2026/09/22 10:22阅读量 2

针对AI Agent时代算力需求从“脉冲式”向“长流持续”转变的趋势,浪潮信息在AICC 2026上发布超节点AI服务器元脑SD200 Ultra和多元算力机组元脑HC2000。前者通过128芯片单机部署、统一寻址及超级算子技术突破单节点智能上限;后者利用液冷底座与MCIS软件栈实现多元算力协同,提升Token产能。此举旨在解决前沿模型运行稳定性与大规模推理成本问题,推动算力产业从“提供算力”向“生产智能”转型。

事件概述

随着AI Agent技术的爆发,算力需求发生质变:从单次问答的“脉冲式”调用转变为连续数小时甚至数天的“长流”负载。IDC数据显示,全球AI推理任务量预计至2030年增长4000万亿次,Token消耗复合增长率达4822.6%,而算力供给满足率却呈下降趋势,导致巨大的算力缺口。单纯堆叠同构算力无法应对Prefill(预填充)与Decode(解码)等不同阶段对计算密度、内存带宽及KV Cache访问的差异化需求。

在此背景下,浪潮信息于AICC 2026提出将算力瓶颈拆解为“Capability(能力上限)”与“Capacity(产能规模)”两个维度,并发布相应解决方案以捅破能力天花板、瓦解产能焦虑。

核心信息

1. 突破单节点智能上限:元脑SD200 Ultra

该产品旨在解决大模型“装不下、跑不快、跑不稳”的问题,支持单机部署高达10万亿参数的模型(如Kimi K3等前沿模型)。

  • 紧致扩展架构:基于3D Hyper Mesh架构,整机芯片数量增至128颗,显存提升至8TB,扩展存储达64TB,将海量资源压缩于单一物理边界内。
  • 通信优化
    • 统一寻址:通过全局编址和虚拟影子设备注册,使128颗芯片显存形成统一地址空间,实现远端资源的直接访问,跳过消息通信与数据搬移。
    • 对称直连:利用对称内存技术实现GPU显存直连,由GPU发起通信,缩短路径并降低延迟。All-to-All通信时延降至0.69微秒。
  • 超级算子技术:将Attention、FFN、MoE等基础算子融合为计算与通信一体的大算子,算子数量减少至十分之一,显著降低内核启动次数和显存访问开销。运行Kimi K3时,推理性能提升3倍以上,Token生成时延低至5.85毫秒。
  • 高稳定性设计:采用铜互联方案替代光电转换,减少长时间运行中的电路故障风险,保障Agent长链路任务的连续性。

2. 提升Token产能效率:元脑HC2000

该产品面向大规模推理场景,核心思路是让不同类型的算力各司其职,通过硬件底座与软件栈协同提升产能。

  • 高密液冷硬件底座
    • 采用全液冷设计与高通流供电,单柜供电能力超300千瓦,承载最多256张AI加速卡,算力密度为传统风冷机柜的4倍。
    • 升级Directcom 2.0通信架构,柜内聚合带宽达200Tbps,跨柜多平面无损扩展,All-to-All通信性能提升50%以上。
  • 多元算力协同(MCIS软件栈)
    • 分工协作:Prefill阶段使用大算力芯片匹配高并行特征;Decode阶段选用大容量HBM芯片兼顾容量与带宽;FFN环节采用3D RAM堆叠芯片缩短搬运路径。
    • 动态调整:构建测量、分配、监控、调整的完整流程,根据业务负载变化实时优化PD(Prefill/Decode)配比和实例分配。
    • KV Cache优化:打通不同类型算力间的点对点数据直传,避免CPU中转;结合冷热分级存储与多级流水并行聚合,使节点内磁盘I/O性能提升32倍。
  • 效能成果:在典型Agent任务场景中,同等投资下实现10倍的Token产能提升。

值得关注

浪潮信息强调,“能力”与“产能”并非孤立路线,而是互为因果的螺旋上升关系。前沿模型的突破(Capability)通过工程迭代降低成本,转化为规模化供给(Capacity);而普及后的应用需求又反过来推动更高阶能力的探索。这一逻辑标志着AI算力产业的价值尺度正从单纯的“提供算力”转向“生产智能”,即用户购买算力设施应如同购买家电般便捷,能够直接高效地产出智能结果。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。