国产首个十万卡集群曙光8000亮相WAIC,上线首周即满载
2026/07/21 14:58阅读量 1
中科曙光首台全国产十万卡量级AI超集群系统曙光8000(登峰)在2026年世界人工智能大会亮相,上线首周即实现应用满载运行,日均处理作业超15万个。该系统采用“超智融合”技术路线,兼顾AI训练与科学计算,已支撑超300个重点科学工程计算应用,并为下一代十万亿参数大模型预留空间。
事件概述
2026年7月,中科曙光首台全国产十万卡量级AI超集群系统“曙光8000(登峰)”正式落成并亮相世界人工智能大会(WAIC)。系统上线首周即实现应用满载运行,目前日均处理作业数突破15万个,单日峰值超过50万个。已为超过400个主流模型提供线上推理服务,并与国内大模型团队完成语言、语义、世界模型等万卡级预训练。
核心信息
- 技术路线:曙光8000采用“超智融合”架构,同一计算单元可同时覆盖科学工程计算(FP64)与神经网络计算(INT8),支持混合精度调用。底层平台由6款核心国产芯片、存储和互连系统构成。
- 互连方案:在Scale-Up层面,单柜集成640张加速卡,优先采用铜互联以降低时延和功耗;机柜间通过自研400G高速网卡和880G交换芯片构建原生RDMA网络(Scale Fabric),实现十万卡规模下的高带宽低时延通信。中科曙光表示该网络未来有望实现对InfiniBand的全面国产化替代。
- 可靠性保障:通过提升单点可靠性、采用相变浸没式液冷维持恒温环境,降低故障率。
- 应用覆盖:已优化超300项超智融合应用,覆盖大模型、机器人、创新药、天文气象等20余个领域,其中70余项完成万卡规模扩展;蛋白质折叠、万亿原子水分子模拟、百万亿网格湍流模拟等也已跑通。
- 局限与下一步:中科曙光表示当前尚无单一模型能跑满10万卡,集群超智融合模式可充分利用算力。下一阶段将启动第二套全国产十万卡系统,更聚焦AI4S,减少对纯AI场景的兼顾。
值得关注
- 曙光8000是国内首个明确采用“超智融合”技术路线的十万卡集群,其成功运营标志着国产AI基础设施在系统集成、工程经验上迈过重要门槛。
- 集群规模扩张带来的性能线性增长与可靠性挑战,促使中科曙光在互连、液冷、网卡/交换芯片等环节自研破局。
- 当模型扩展速度落后于基础设施建设速度时,“超智融合”成为有效利用算力的关键路径,尤其服务于AI for Science领域。
