AI Infra效率革命:如何把GPU从空转中解放出来

2026/08/01 16:19阅读量 2

随着大模型推理需求爆发,AI Infra成为新的千亿级市场。谷歌、OpenAI等巨头加速自研芯片,开源推理引擎vLLM和SGLang相继商业化。CMU研究显示GPU存在大量执行空转,通过KV Cache复用、连续批处理等技术可显著提升利用率,软件层优化正成为行业竞争焦点。

事件概述

AI行业正在爆发“造芯大战”,但并非每家公司都有能力自研芯片。与此同时,AI Infra(人工智能基础设施层)赛道快速升温,核心逻辑是:已部署的数据中心和GPU仍有巨大优化空间。开源推理引擎vLLM和SGLang先后宣布商业化,种子轮融资均超1亿美元,背后聚集了AI产业巨头和顶级风投。

核心信息

  • 谷歌正在研发代号为“Frozen v2”的服务器芯片,计划将Gemini模型部分架构直接固化进硅片;OpenAI联合博通研发的首款推理芯片Jalapeño,从设计到流片仅用九个月。
  • AI推理平台Baseten一年收入增长20倍,估值从21亿美元涨至130亿美元;Fireworks七个月内估值翻四倍至175亿美元,年化营收突破10亿美元。
  • Meta、Google、Microsoft等科技巨头今年合计资本开支预计超1万亿美元;黄仁勋预测,到2030年全球AI基础设施年投资规模将达到4万亿美元。

GPU利用率:看似繁忙实则空转

卡内基梅隆大学(CMU)今年4月发布的研究显示,对一个大型学术AI集群中756块GPU进行31天细粒度遥测后,整体有近20%的执行时间和约11%的能耗浪费在执行等待上。推理场景尤其严重:Azure Code负载有高达65%的能耗消耗在这种空转中,OpenAI的Chat类请求也达到52%。

AI Infra四层架构

  1. 能源基础设施:电力和散热,决定GPU能否持续稳定运行。
  2. 计算硬件:GPU、HBM、NVLink/InfiniBand、CPU等,决定理论计算上限。
  3. 系统软件:CUDA、编译器、通信库、内存管理和算子库,决定每次计算能否触及硬件物理极限。
  4. 服务编排:推理引擎、训练框架、请求调度和资源管理,代表项目有vLLM、SGLang。

前两层是“硬”问题,改造周期以年计算;后两层是“软”问题,工程优化可带来数倍性能提升,因此行业注意力正快速向软件层和服务编排层转移。

关键技术:让GPU不闲着

1. KV Cache复用

大模型推理中,同一段文字反复输入时会重复计算,业界称之为“推理税”。Anthropic曾通过KV Cache复用直接把成本砍掉90%。SGLang的核心技术RadixAttention使用基数树(Radix Tree)组织KV Cache,支持跨请求、跨机器共享和复用缓存。配合缓存感知调度(Cache-aware scheduling)、淘汰机制、分布式缓存感知负载均衡等策略,可显著减少重复计算。

2. Continuous Batching(连续批处理)

传统批处理需凑齐一批请求再计算,长短请求互相等待。连续批处理允许请求随时进入和退出,GPU始终保持满载,实际吞吐量可提升2到4倍。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。