DeepSeek开源昇腾基础组件,实测通信性能逼近硬件上限
9月30日,DeepSeek正式面向华为昇腾算力平台开源基础设施组件,涵盖TileLang编译工具、高性能算子库及分布式通信库。基于昇腾950超节点集群的实测数据显示,DeepEP通信库带宽接近硬件上限,DeepSeek-V4.1-Flash模型在离线推理模式下单卡吞吐最高达5102 tokens/s,标志着国产AI芯片软件生态的重要进展。
事件概述
2026年9月30日,DeepSeek官方宣布正式开源面向华为昇腾(Ascend)算力平台的基础设施组件。此次开源内容与此前面向GPU平台发布的组件一一对应,旨在共建高效、易用的AI芯片软件生态。该举措被视为中国AI软件生态发展的里程碑,为算力平台提供了新的选择。
核心技术与性能数据
1. 开源组件与技术栈
DeepSeek发布了多款高性能昇腾算子库组件,包括:
- DeepGEMM
- FlashMLA
- TileKernel
- DeepSelect
- DeepEP(分布式通信库)
这些组件依托华为开放的 Ascend C API 接口和 PTO ISA 底层指令体系开发。Ascend C 允许用户对访存路径及计算流水线进行深度调优,既支持资深开发者进行精细的手工调优,也通过 TileLang 高级语言编译工具对接不同开发范式。
2. 硬件支持与网络架构
华为向DeepSeek团队提供了联合定义的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案:
- Scale-up网络:128卡单层交换,带宽3.2Tbps。
- Scale-out网络:256K卡两层交换。
- 该架构旨在支持超低时延推理和前沿基座模型的大规模训练。
3. 通信性能实测
基于全互联的UBL128超节点,DeepSeek开发了高性能 DeepEP 通信库,涵盖 EP/CP/PP/FSDP 等模式下的通信算子。实测通信性能如下:
- Dispatch带宽:375 GB/s
- Combine带宽:347 GB/s
- 结论:通信性能已接近硬件上限,为更大模型向更大集群扩展提供支持。
4. 推理部署性能表现
为支持广泛开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将联合创新成果在CANN社区开源。针对大规模推理场景,基于 EP32 部署策略,在Offline推理模式下(ContextLength=128K,Dspark投机接受率0.85),DeepSeek-V4.1-Flash 模型的性能数据如下:
- TPOT = 5ms:每卡输出吞吐 2469 tokens/s
- TPOT = 10ms:每卡输出吞吐 5102 tokens/s
(注:Benchmark数据均基于Offline推理模式采集,不包含Serving调度和框架负载均衡影响。)
值得关注
此次开源不仅包含了核心的算子和通信库,还涵盖了从预训练、微调到低延迟推理的全链路优化实践,例如:
- 大EP低延时推理部署
- 超长文本KVcache池化
- Agentic RL训练实践
- 基于PyTorch原生框架的预训练实践
华为与DeepSeek将持续深耕“芯模协同”,通过深度适配打通从推理到训练的全链路,打造开放、高效的AI软件生态。
