GPU算力未标准化:为何旧芯片租金反升?核心在于系统协同与利用率
2026/08/26 16:00阅读量 2
AI算力尚未成为像电力或带宽一样的标准化商品,因为单张GPU的性能已无法独立决定交付能力,必须依赖高速互联的超节点系统进行多卡协同。尽管硬件迭代迅速,但受限于重资产折旧、网络拓扑及调度软件效率,旧一代GPU若保持高利用率,其单位Token成本可能低于低效运行的新设备。因此,算力价值的核心已从单一芯片转向整体基础设施的系统整合与运营效率。
事件概述
在AI基础设施领域,市场曾预期GPU算力会随供应增加和硬件迭代逐渐标准化、商品化,即性能提升而价格下降。然而,现实情况相反,部分早期部署的GPU(如2023年的H100)当前出租价格甚至高于初始上线时。云服务商Lambda联合创始人兼CTO Stephen Balaban指出,这反映了AI算力系统远未实现标准化,其价值不再仅由单张芯片型号决定,而是高度依赖于系统架构、协同能力及运营效率。
核心信息
1. 算力非加法题:超节点与协同瓶颈
- 单卡失效:前沿大模型的训练和推理任务无法由单张GPU独立完成,需将参数、计算和数据拆分至多张GPU或多台服务器。此时,算力交付能力取决于GPU间的数据交换速度,而非单纯芯片速度。
- 通信效率关键:网络拓扑、内存、存储及软件组织方式的差异直接影响最终算力。新增一张GPU并不必然带来等比例的标称性能产出,若通信效率不足,芯片将大量时间耗费在等待数据上。
- 超节点形态:为解决此问题,行业转向“超节点”架构。例如英伟达GB300 NVL72通过NVLink在机架内互联72颗GPU,并通过InfiniBand或高速以太网扩展至多机架。这种设计旨在降低互连成本,使多GPU像单机一样工作,服务于大规模训练及日益增长的复杂推理需求。
2. GPU的三重时间尺度:迭代、折旧与经济寿命
- 重资产属性:AI数据中心是典型的重资产生意。以千兆瓦级工厂为例,服务器和计算设备投入可达350亿-450亿美元,其中GPU占比最大。
- 三套时钟体系:
- 产品迭代:决定芯片是否为最新一代。
- 会计折旧:通常按约六年分摊账面成本。
- 经济寿命:决定设备产生收入的实际时长。只要旧款GPU(如H100)仍能承担计算任务且有市场需求,其经济寿命可能远超市场预期,不会因新品上市立即贬值。
- 纵向整合服务:Neocloud(AI算力云)并非简单的GPU租赁商,而是涵盖土地、电力、数据中心建设、高性能计算设计及云软件的纵向整合服务。客户购买的是整套系统交付计算能力的结果。
3. 利用率决定Token成本差距
- 成本传导链条:能源 -> 电力 -> 数据中心基础设施(制冷/配电) -> 计算设备(GPU/网络/存储) -> Token生成。每一环节的损耗都影响最终成本。
- 闲置成本高昂:GPU等设备即使闲置也会产生折旧。若利用率为50%,每个实际使用小时的折旧成本将翻倍。
- 调度复杂性:在万卡级集群中,分配算力需同时协调CPU、存储和网络资源。高效的集群调度软件决定了昂贵物理设备能否被拆分并持续交付给不同客户。缺乏软件优化,大量GPU仍可能处于低效或空转状态。
值得关注
- 标准化误区:虽然顶层AI服务已将输出标准化为Token并按量计费,但底层的算力生产系统仍未标准化。芯片本身可标准化,但其组织方式和性能发挥程度仍具高度差异性。
- 竞争焦点转移:AI Infra的竞争焦点已从“拥有多少GPU”转向“如何减少GPU闲置”以及“如何通过软硬件协同最大化系统吞吐量”。
