AI数据中心新瓶颈:网络拥堵比芯片算力更“卡脖子”

2026/08/17 17:42阅读量 2

当AI集群迈向万卡甚至十万卡规模,网络已成为制约算力释放的核心瓶颈。数据显示,GPU在训练中超过60%时间用于等待数据,大模型训练因网络问题的失败率高达21%。行业正从堆硬件转向协议与调度优化,LLR、CBFC等新技术开始走向落地,而系统级网络验证环节仍被多数企业忽视。

事件概述

AI算力竞赛的焦点正在从单颗GPU的算力转向集群网络的传输效率。在千卡、万卡乃至十万卡规模的训练集群中,芯片之间搬运数据的速度远跟不上算力增长,网络拥堵已成为制约AI基础设施的核心因素。

核心信息

  • GPU大量时间在“等数据”:在计算机视觉模型训练中,GPU超过60%的时间用于数据移动和通信,真正用于计算的时间仅约20%。
  • 网络故障导致训练频繁中断:大语言模型训练中,因网络问题导致的训练失败率高达21%,一次中断可能浪费数小时甚至数天的算力成果。
  • 网络用量暴增:以GPU为中心的计算节点需配置8张以上网卡,相比传统CPU节点,数据中心高速网络用量提升了10到20倍。
  • 传统负载均衡失效:传统逐流ECMP哈希算法难以应对GPU集群潮水般的并发流量,造成部分端口满载、部分闲置。新的端到端负载均衡方法可将带宽利用率提升最高38%,模型训练时长缩短超过3%。

技术新方向

面对瓶颈,行业正从堆硬件转向协议和流量调度优化。

  • LLR(链路层重传):将丢包重传机制下沉到链路层,由交换机自主发现并重传,恢复时间从毫秒级降到微秒级,解决传统TCP/IP网络在AI场景下的重传延迟问题。
  • CBFC(基于credit的流控):发送端在发送数据前先确认接收端缓存空间,类似“网络红绿灯”,避免大规模并发汇聚时的丢包。
  • 互操作性突破:2026年3月,是德科技与Broadcom在OFC 2026上完成了业界首个基于超以太网联盟规范、在800GE线速下实现LLR和CBFC的公开互操作性演示,标志这两项技术开始从实验室走向真实部署。

网络验证成关键短板

许多企业采购最新设备和光模块后,跑标准benchmark显示带宽、延迟达标,但一跑大模型训练就出现掉线、卡顿、速度不达标。根因在于验证环节缺失有效方法。

  • Scale-Up环节最易被忽视:机柜内GPU之间的参数同步和梯度聚合依赖短距离Scale-Up网络,该环节技术快速迭代,也是LLR和CBFC的关键应用场景。
  • Scale-Out与Scale-Across同样复杂:前者涉及大规模交换机间复杂拓扑,传统验证方式无法反映真实负载压力;后者面临跨数据中心长距离传输的延迟和可靠性考验。
  • 真实负载测试尤为重要:是德科技调查显示,95%的运营商认为真实工作负载测试对AI网络验证至关重要,但多数企业仍在用传统数据中心的测试方法。
  • 推理场景要求更严格:AI嵌入实时对话、自动驾驶、高频交易等场景后,首Token时延和Token间时延的稳定性直接决定用户体验,网络抖动会立即转化为“卡顿”。

值得关注

芯片算力增速远超数据搬运速度,网络已成为决定AI算力能否真正释放的“命门”。未来五年AI集群东西向流量预计增长10倍以上,仅靠堆硬件无法解决根本问题,系统级网络验证能力和精细化流量调度将成为AI基础设施竞争的核心。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。