从兆瓦到Token:NVIDIA DSX如何最大化AI工厂算力产出

2026/09/16 00:55阅读量 1

NVIDIA推出DSX平台,通过协同优化计算、网络、电力和冷却系统,旨在提升每瓦特电力产生的AI Token吞吐量。实测数据显示,在固定功率预算下,Lambda的集群实现了24%的Token吞吐量增长和23%的能效提升;同时,Emerald AI与硅谷电力合作验证了数据中心可在分钟内自动响应电网需求信号,降低负荷而不中断关键任务。

事件概述

随着AI基础设施规模扩大,电力成为主要约束条件。NVIDIA提出“AI工厂”概念,强调不再单独优化硬件组件,而是通过整体设计(Compute, Networking, Power, Cooling, Operations)来最大化单位电力的产出效率。其核心解决方案为 NVIDIA DSX (Data Center Software eXtensions) 平台,旨在帮助基础设施构建者在现有电网容量内释放更多算力。

核心信息与实测数据

1. DSX MaxLPS:突破固定功率预算限制

  • 机制:动态监控GPU和机架级别的功耗,根据工作负载类型重新分配剩余容量,回收静态配置中被浪费的“ stranded capacity ”(闲置容量)。
  • Lambda实测结果
    • 在基于 HGX B200 GPU服务器的五机架、19节点集群中,以85%的功率运行19个节点,对比全功率运行16个节点的同等预算场景。
    • Token吞吐量提升24%:从约每秒400万Token提升至500万Token。
    • 每瓦性能提升23%
  • 未来预期:针对下一代 Vera Rubin NVL72 AI工厂,在相同兆瓦级功率预算下,预计可支持高达40%的额外GPU容量。

2. DSX Flex:电网灵活性与自动化响应

  • 案例背景:硅谷电力(Silicon Valley Power)向位于圣克拉拉的AI工厂发送需求响应信号,测试电网灵活性。
  • 执行方:NVIDIA合作伙伴 Emerald AIConductor 平台(作为DSX Flex的前身/早期示例)。
  • 响应过程
    • 收到电网信号后,系统在不到一分钟内自动调整。
    • 优先级低的工作负载被推迟或降速,高优先级的推理服务保持运行。
    • 总功耗从4兆瓦降至3兆瓦,全程无需人工干预。
  • 成效:该工厂已接收超过200次需求信号,成功率100%。这证明了AI工厂可作为可调度资源参与电网平衡。
  • 未来部署:首个专用的DSX Flex商业部署将在弗吉尼亚州Manassas的96兆瓦Vera Rubin AI工厂进行。

3. 架构演进:800V DC电源架构

  • 趋势:随着加速计算机架密度增加,传统低压路径带来转换复杂性和分布限制。
  • 方案:NVIDIA引入 800V DC 架构,旨在减少转换复杂性,提高供电效率,并支持更密集的机架。
  • 预期收益:相比54V分布式电源,预计端到端效率提升3-5%,该架构将整合进DSX参考设计中,预计随Vera Rubin NVL72于2027年可用。

值得关注的关键结论

  1. 整体优化优于局部优化:正如NVIDIA创始人黄仁勋所言,“1千兆瓦的工厂永远不会变成2千兆瓦的工厂”。解决物理极限的唯一途径是停止优化单一部件,转而设计整个系统。
  2. DSX套件构成
    • DSX MaxLPS:优化每兆瓦吞吐量,实时监测与动态分配。
    • DSX Flex:响应电网信号,调整工作负载优先级。
    • DSX OS:开源模块化软件,管理生命周期、运行时一致性和健康自动化。
    • DSX Sim:仿真工具,在物理部署前建模和验证工厂设计,识别瓶颈。
    • DSX Reference Designs:经生态伙伴联合设计的特定代际验证架构。
  3. 行业意义:通过提升“每瓦特Token数”,AI工厂可以在不等待十年建设新输电线路的情况下,利用现有电网基础设施实现规模化扩展。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。