OpenAI 联合博通发布自研推理芯片 Jalapeño:能效超越英伟达,研发周期仅九个月
OpenAI 与博通联合推出的首款 AI 推理芯片 Jalapeño 公布首轮测试成绩,在 InferenceX 基准测试中,其每瓦 AI 工作负载效率比英伟达 GB200/GB300 高出 1.5—1.9 倍,端到端延迟缩短至 30%—60%。该芯片专为大模型推理优化,采用 HBM4 内存和协同架构设计,显著降低功耗并提升数据吞吐能力。从正式设计到流片仅耗时 9 个月,展现了 AI 辅助硬件研发的加速效应,标志着头部模型厂商正通过自研芯片掌控算力成本与供给主导权。
事件概述
OpenAI 近日公布了与博通(Broadcom)联合自研的首款 AI 推理芯片 Jalapeño(墨西哥辣椒)的首轮公开测试成绩。该芯片旨在解决大模型推理过程中的性能瓶颈,特别是在 AI Agent 场景下的高并发、低延迟需求。测试数据显示,Jalapeño 在能效比和响应速度上均大幅优于当前市场主流的高端 GPU。
核心性能与技术细节
1. 基准测试表现
在 SemiAnalysis 发布的公开基准测试 InferenceX 中,Jalapeño 运行了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款模型,结果如下:
- 能效优势:每瓦完成的 AI 工作负载比英伟达 GB200、GB300 多出 1.5—1.9 倍。
- 延迟优化:端到端延迟缩短至对照系统的约 30%—60%。
- 具体案例:运行 DeepSeek R1 时,一次 8K 输入、1K 输出的推理时间从 5.99 秒降至 1.65 秒;最低 token 间隔由 5.90ms 压至 1.43ms。
2. 架构设计:针对“内存墙”的优化
大模型推理分为 Prefill(预填充)和 Decode(解码)两个阶段。Decode 阶段需要反复读取权重和 KV Cache,极易受限于数据搬运速度(即“内存墙”)。Jalapeño 的设计重点在于打破这一限制:
- 高带宽内存:配备 216GiB HBM4,内存带宽达到 15.4TB/s,约为微软 Maia 200 和 Google Ironwood 的两倍,确保数据能跟上计算核心。
- 局部性优化:将计算核心与 HBM 划分为多个对应区域,使模型权重和 KV Cache 尽量保留在本地内存中,跨区域同步时才通过高速通信网络传输,减少数据搬运步骤。
- 协同设计:计算核心、HBM 和网络资源在芯片设计初期即进行统筹考虑,以最小化读取数据的耗时。
3. 能效与功耗
- 标称功耗:700W。
- 实际持续功耗:低于 550W。
- 对比:英伟达 GB200 和 GB300 的标称功耗分别为 1200W 和 1400W。Jalapeño 以约一半的能耗实现了更高的推理性能,有助于显著降低数据中心的电力成本。
研发历程:AI 加速芯片开发
Jalapeño 的研发速度打破了行业常规,体现了 AI 技术在硬件开发中的反向赋能作用。
- 时间线梳理:
- 2024 年底 - 2025 年初:项目正式启动,初始成员多来自 Google TPU 团队。
- 2025 年 2 月:进入正式设计周期。
- 2025 年 11 月:完成流片。
- 2026 年 5 月:OpenAI 拿到第一块成品芯片。
- 2026 年 8 月:完成调试并开启公开测试。
- 速度对比:传统高复杂度 AI 加速芯片从设计到流片通常需 18—24 个月,OpenAI 将其压缩至 9 个月,速度接近一倍。
- AI 参与研发:OpenAI 的模型直接参与了 Jalapeño 的方案探索、验证修改及算术电路优化。此外,利用 Codex 和未发布的 Astra 模型,在两个月内完成了多款非原始适配模型的兼容。
行业背景与战略意义
1. 自研芯片成为头部模型厂商共识
除了 OpenAI,其他科技巨头也在推进专用芯片研发:
- Google:TPU 已迭代至第八代,其中 TPU 8i 专为推理设计;同时研发代号 Frozen v2 的服务器芯片,试图将 Gemini 架构固化进硬件,预计每瓦生成 token 数量可达最新 TPU 的 6—10 倍。
- Amazon AWS:推出 Inferentia(推理)和 Trainium(训练/推理)芯片。
- Anthropic:虽大量采购亚马逊 Trainium 芯片,但也正在组建内部团队为下一代 Claude 打造定制芯片。
2. 经济账与供应链安全
- 成本控制:随着计算效率提升,API 调用价格大幅下降。例如,GPT-5.6 Luna 相比 GPT-4o,同等任务成本降幅超过 94%。自研芯片有助于模型公司掌握算力成本主导权,通过节省巨额支出收回研发投资。
- 供给保障:依赖外部供应商(如英伟达或云服务商)存在产能和报价风险。拥有自有芯片可确保关键推理算力的稳定供给,避免受制于人。
3. 战略定位
OpenAI CFO Sarah Friar 提出“以广度建生态,以自营握杠杆”的战略:训练和通用计算继续采购外部高端系统,而稳定且巨量的推理任务则由 Jalapeño 分担。第一代 Jalapeño 暂不出售或出租,产能全部用于 OpenAI 自身基础设施。
