NVIDIA Groq 3 LPX全面投产,Vera Rubin推理平台扩展至代理型AI

2026/08/24 23:00阅读量 2

NVIDIA宣布Groq 3 LPX已全面投产,与Vera Rubin NVL72协同,在10万token长上下文场景下实现每秒3400输出token,较最接近的替代平台快4倍。SpaceXAI、CoreWeave、Nebius等伙伴同步采用相关平台,同时发布Spectrum-X Multiplane和Scale-In基础设施,推动AI工厂向智能体推理演进。

事件概述

NVIDIA在Hot Chips会议上宣布,其Vera Rubin推理平台扩展至代理型(agentic)AI,推出全面投产的NVIDIA Groq 3 LPX。该加速器与Vera Rubin NVL72机架级系统协同设计,旨在解决智能体AI在长上下文推理中的解码延迟问题,提升token生成速度和基础设施效率。

关键性能与架构

  • 在Artificial Analysis基准测试中,Groq 3 LPX运行Gemma 4 31B开源代理模型,在10万token长上下文场景下实现每秒3400个输出token,较最接近的替代平台快4倍。
  • 架构上,Rubin GPU负责大规模上下文处理,LPX加速延迟敏感的解码工作负载,二者协同消除速度与吞吐量之间的传统取舍。
  • 机架级部署可包含256个LP30加速器,通过直接chip-to-chip链路互连,形成面向现代AI工厂的高效推理引擎。

行业采用与合作

  • SpaceXAI:计划围绕NVIDIA Vera Rubin构建未来AI架构,覆盖地球数据中心至轨道卫星,将部署Vera CPU加速编排、工具调用、代码执行、数据处理和模拟等CPU密集型任务。
  • CoreWeave:已投产部署Spectrum-X Multiplane,用于连接Vera Rubin机架,提供高带宽、扁平、无损AI网络。
  • Nebius:成为首个采用NVIDIA Groq 3 LPX的AI云,将其加入Vera Rubin NVL72的Token Factory,以提升推理性能,支持高交互式代理应用。

网络与基础设施扩展

  • Spectrum-X Multiplane:通过将每台服务器的网络连接拆分为多个独立平面,无需增加第三层网络即可扩展到51.2万个GPU。在八平面拓扑中,单平面故障仍可维持约90%总带宽,硬件恢复速度比软件负载均衡快11倍,AI工厂输出提升1.6倍。
  • NVIDIA Scale-In:基于BlueField-4处理器和DOCA软件平台,将网络、存储、安全和运维等基础设施服务加速,作为AI网络第五大支柱,支持多租户网络、高性能存储访问和实时可观测性。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。