英伟达发布Nemotron 3.5与NeMo Switchyard,从卖芯片走向卖AI工作流
2026/08/12 08:57阅读量 5
英伟达推出面向企业AI智能体的Nemotron 3.5 Lightning混合专家模型与开源模型路由器NeMo Switchyard。前者总参数约300亿、单次推理仅激活约30亿,输出速度最高提升约4倍,定位为多智能体系统中的执行型模型;后者在智能体工作流每一步按质量、延迟、成本等策略动态调度模型。这标志着英伟达正从单纯销售芯片向提供整套AI工作流延伸。
事件概述
英伟达发布了两款面向企业AI智能体生态的新产品:
- Nemotron 3.5 Lightning:主打高效率的混合专家(MoE)模型,定位为多智能体系统中的“执行型”模型;
- NeMo Switchyard:开源的智能体模型路由库,负责在智能体工作流中按策略调度模型。
核心信息
Nemotron 3.5 Lightning:为执行而生
- 总参数约300亿,单次推理仅激活约30亿参数;
- 相比同类模型,输出速度最高提升约4倍,智能体任务完成速度提升约30%。英伟达也指出,模型推理只是智能体工作流的一环,工具调用、API响应与多智能体任务编排仍会形成瓶颈,因此实际任务提速被压缩至约30%;
- 定位并非取代前沿推理模型,而是承担代码审查、安全监控、数据处理、告警分析等专业化执行任务;
- 第三方评测机构Artificial Analysis数据显示:Intelligence Index得分24,较上代小尺寸型号Nemotron 3 Nano高9分,与OpenAI的gpt-oss-120b相当,落后于规模约为其4倍的Nemotron 3 Super仅2分;
- GDPval-AA v2评测Elo达824,超越Nemotron 3 Super与gpt-oss-120b;Terminal-Bench v2.1得分24%,而Nemotron 3 Nano仅7%;
- 预发布测试中,输出速度接近每秒670个token。
开放定制与低成本后训练
- 企业可在自有硬件上使用NeMo对Lightning进行二次训练,英伟达同步开放了数据集、后训练数据集及训练配方与框架;
- 案例:CodeRabbit用标准模型配方训练约两小时、花费85美元即产出一个路由智能体;有合作方将Lightning直接放入已有后训练栈,无需改动;有公司用单张H100完成训练;也有公司夜间运行训练、早上直接获取结果。
NeMo Switchyard:模型调度成为新的软件层
- 开源模型路由库,根据当前可用模型及其能力,在智能体工作流的每一步将请求路由至最合适、最高效的模型;
- 开发者可按质量、延迟、成本等优先级自定义路由策略,无需让每个任务都调用最贵的模型;
- 已与Boomi、Cadence Design Systems、Classmethod、Cognition、Kong、Langchain、Nous Research、Siemens等生态伙伴合作,将智能路由接入开发者现有工具链。
值得关注
- Nemotron 3家族于去年12月推出,含Nano、Super、Ultra三个尺寸。据The Information报道,英伟达正在开发下一代Nemotron 4,目标参数量至少1万亿,约为Nemotron 3 Ultra的两倍,旨在比肩全球顶尖开源模型;
- 英伟达已组建包含Reflection、Cursor、Thinking Machines、Mistral等的“Nemotron联盟”,各方在推进自身模型的同时向Nemotron 4贡献训练数据、评估支持与设计方案;
- 英伟达芯片需求高度集中于OpenAI、微软、SpaceX等少数前沿实验室和云服务商,且已向OpenAI投资300亿美元;Nemotron 4定位为企业提供成本更低的替代方案,与前沿实验室形成直接竞争;
- AI模型评测机构Arena CEO表示:“无论哪家公司做出优秀的开源模型,英伟达都是赢家。”开源生态越繁荣、参与主体越多元,GPU整体需求就越旺盛。英伟达的角色正在从卖芯片转向卖整个AI工作流。
