DeepSeek开源昇腾基础组件,实测通信性能逼近硬件上限

2026/09/30 10:53阅读量 2

9月30日,DeepSeek正式面向华为昇腾算力平台开源基础设施组件,涵盖TileLang编译工具、高性能算子库及分布式通信库。基于昇腾950超节点集群的实测数据显示,DeepEP通信库带宽接近硬件上限,DeepSeek-V4.1-Flash模型在离线推理模式下单卡吞吐最高达5102 tokens/s,标志着国产AI芯片软件生态的重要进展。

事件概述

2026年9月30日,DeepSeek官方宣布正式开源面向华为昇腾(Ascend)算力平台的基础设施组件。此次开源内容与此前面向GPU平台发布的组件一一对应,旨在共建高效、易用的AI芯片软件生态。该举措被视为中国AI软件生态发展的里程碑,为算力平台提供了新的选择。

核心技术与性能数据

1. 开源组件与技术栈
DeepSeek发布了多款高性能昇腾算子库组件,包括:

  • DeepGEMM
  • FlashMLA
  • TileKernel
  • DeepSelect
  • DeepEP(分布式通信库)

这些组件依托华为开放的 Ascend C API 接口和 PTO ISA 底层指令体系开发。Ascend C 允许用户对访存路径及计算流水线进行深度调优,既支持资深开发者进行精细的手工调优,也通过 TileLang 高级语言编译工具对接不同开发范式。

2. 硬件支持与网络架构
华为向DeepSeek团队提供了联合定义的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案:

  • Scale-up网络:128卡单层交换,带宽3.2Tbps。
  • Scale-out网络:256K卡两层交换。
  • 该架构旨在支持超低时延推理和前沿基座模型的大规模训练。

3. 通信性能实测
基于全互联的UBL128超节点,DeepSeek开发了高性能 DeepEP 通信库,涵盖 EP/CP/PP/FSDP 等模式下的通信算子。实测通信性能如下:

  • Dispatch带宽:375 GB/s
  • Combine带宽:347 GB/s
  • 结论:通信性能已接近硬件上限,为更大模型向更大集群扩展提供支持。

4. 推理部署性能表现
为支持广泛开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将联合创新成果在CANN社区开源。针对大规模推理场景,基于 EP32 部署策略,在Offline推理模式下(ContextLength=128K,Dspark投机接受率0.85),DeepSeek-V4.1-Flash 模型的性能数据如下:

  • TPOT = 5ms:每卡输出吞吐 2469 tokens/s
  • TPOT = 10ms:每卡输出吞吐 5102 tokens/s

(注:Benchmark数据均基于Offline推理模式采集,不包含Serving调度和框架负载均衡影响。)

值得关注

此次开源不仅包含了核心的算子和通信库,还涵盖了从预训练、微调到低延迟推理的全链路优化实践,例如:

  • 大EP低延时推理部署
  • 超长文本KVcache池化
  • Agentic RL训练实践
  • 基于PyTorch原生框架的预训练实践

华为与DeepSeek将持续深耕“芯模协同”,通过深度适配打通从推理到训练的全链路,打造开放、高效的AI软件生态。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。