Grok 4.5发布背后:马斯克算力规模庞大,但利用率仅11%的工程困局
2026/07/24 22:51阅读量 2
SpaceXAI发布Grok 4.5,定位便宜且快,但此举与之前马斯克将大量GPU出租给Anthropic和谷歌的行动一致,暴露其算力利用率仅11%的短板。根源在于调度器和编译器等工程软件缺陷。MoE架构虽缓解部分问题,但核心软件优化仍需突破。
事件概述
7月9日,SpaceXAI发布Grok 4.5,不再追求“最强”,主打编程、Agent场景,定价比Claude Opus和GPT-5.5便宜60%以上,推理速度高达80 tokens/秒。此前5月至6月,马斯克将Colossus 1数据中心超过22万张GPU租给Anthropic,约11万张GPU租给谷歌,核心原因是SpaceXAI训练Grok时算力利用率仅11%,远低于同行普遍的40%。
核心信息
- 算力利用率低下的原因:大规模GPU集群(22万卡)面临工程软件短板。调度器响应慢,无法像谷歌Meta那样毫秒级自动换卡断点续训,导致“一卡故障,万卡等待”;早期使用的XLA编译器未适配Colossus 1集群物理布局,无法发挥GPU极限性能。马斯克已启动自研C/C++底层编译器。
- 理论算力≠实际算力:实际算力=理论算力×算法效率×工程软件转化率。通信开销随GPU规模非线性飙升,显存带宽不足也会导致“显存饥饿”。
值得关注
Grok 4.5采用混合专家(MoE)架构,将不同功能的“专家模型”部署在独立GPU组,推理时仅激活对应组,大幅降低通信同步压力,提升效率,短暂缓解利用率问题。但调度器、编译器核心软件短板仍未完全攻克。马斯克出租闲置算力是商业止损,发布务实模型是技术妥协,共同说明“驾驭算力”比“拥有算力”更重要。
