NVIDIA发布Nemotron 3.5 Lightning与NeMo Switchyard:开源模型与路由库共建高效Agentic AI
2026/08/11 21:00阅读量 4
NVIDIA推出30B参数的混合专家模型Nemotron 3.5 Lightning,面向高频Agent任务,输出速度提升4倍、任务完成速度提升30%;同时发布开源路由库NeMo Switchyard,可自动将请求分发至最适模型,在保持准确率的同时显著降低成本。两者旨在为多智能体系统提供更灵活、高效的部署方案。
事件概述
NVIDIA扩展Nemotron 3模型家族,推出Nemotron 3.5 Lightning——一款30B参数的混合专家(MoE)开源模型,定位为长时间运行、高并发Agentic AI工作负载设计。同时发布NeMo Switchyard,一个用于Agent工具链的开源智能路由库,可自动将请求分发至最合适、最经济的模型。
Nemotron 3.5 Lightning
- 模型参数:30B MoE,面向大型多Agent系统中的专项任务,如代码审查、工具调用、安全告警监控和账单问答。
- 性能:相比同类模型,输出速度最高提升4倍,Agent任务完成速度提升30%;PinchBench基准显示在同类模型中达到前沿级准确率。
- 可定制性:支持通过NVIDIA NeMo在组织自有数据、工具和工作流上进行后训练,以提升领域准确性。模型由Nemotron Coalition成员参与开发,贡献了评估方法、推理软件和数据集。
- 部署灵活性:可运行于NVIDIA RTX PC、DGX Spark、DGX Station、Jetson等本地设备,也支持边缘、工作站、数据中心和云环境。
- 透明度:NVIDIA按许可允许范围公开训练数据和技术,便于追溯、审计和进一步训练。
- 配套发布:Nemotron-RL-Agentic-Terminal-Pivot,一个用于后训练编码Agent能力的强化学习数据集。
NeMo Switchyard
- 功能:开源模型路由库,可在Agent工作流的每一步自动选择最合适的模型,开发者可调整路由算法以在质量、延迟和成本之间取舍。
- 效果:NVIDIA内部基准显示,相比单独使用Opus 4.8,Switchyard能在保持前沿准确率的同时,将任务完成成本降至近三分之一。
- 合作伙伴案例:
- Boomi:路由准确率100%,59%流量转至5倍更快的微调模型,后期延迟降低21%。
- Cadence:形式验证场景中效率提升9.9%。
- Classmethod:内部测试实现27%成本降低,质量不变。
- Cognition:集成至Devin Desktop,平均成本降低28%,接近前沿性能。
- Kong:通过Kong AI Gateway原生支持。
- LangChain:多轮任务成本降低74%,仅7%请求调用前沿模型,准确率牺牲6%。
- LiteLLM:作为插件加入其代理层。
- Nous Research:集成至Hermes系统。
- Ramp:在SWE-Bench上保持前沿性能,成本降低58%,运行时间减少33%。
- Siemens:正在评估以优化Fuse EDA AI Agent效率。
可用性
Nemotron 3.5 Lightning已可通过Hugging Face、ModelScope、OpenRouter和build.nvidia.com(NIM微服务)获取,并支持NVIDIA云合作伙伴生态。NeMo Switchyard已在GitHub开源,后续将登陆更多合作伙伴平台。
