NVIDIA发布Nemotron 3.5 Lightning与NeMo Switchyard:开源模型与路由库共建高效Agentic AI

2026/08/11 21:00阅读量 4

NVIDIA推出30B参数的混合专家模型Nemotron 3.5 Lightning,面向高频Agent任务,输出速度提升4倍、任务完成速度提升30%;同时发布开源路由库NeMo Switchyard,可自动将请求分发至最适模型,在保持准确率的同时显著降低成本。两者旨在为多智能体系统提供更灵活、高效的部署方案。

事件概述

NVIDIA扩展Nemotron 3模型家族,推出Nemotron 3.5 Lightning——一款30B参数的混合专家(MoE)开源模型,定位为长时间运行、高并发Agentic AI工作负载设计。同时发布NeMo Switchyard,一个用于Agent工具链的开源智能路由库,可自动将请求分发至最合适、最经济的模型。

Nemotron 3.5 Lightning

  • 模型参数:30B MoE,面向大型多Agent系统中的专项任务,如代码审查、工具调用、安全告警监控和账单问答。
  • 性能:相比同类模型,输出速度最高提升4倍,Agent任务完成速度提升30%;PinchBench基准显示在同类模型中达到前沿级准确率。
  • 可定制性:支持通过NVIDIA NeMo在组织自有数据、工具和工作流上进行后训练,以提升领域准确性。模型由Nemotron Coalition成员参与开发,贡献了评估方法、推理软件和数据集。
  • 部署灵活性:可运行于NVIDIA RTX PC、DGX Spark、DGX Station、Jetson等本地设备,也支持边缘、工作站、数据中心和云环境。
  • 透明度:NVIDIA按许可允许范围公开训练数据和技术,便于追溯、审计和进一步训练。
  • 配套发布:Nemotron-RL-Agentic-Terminal-Pivot,一个用于后训练编码Agent能力的强化学习数据集。

NeMo Switchyard

  • 功能:开源模型路由库,可在Agent工作流的每一步自动选择最合适的模型,开发者可调整路由算法以在质量、延迟和成本之间取舍。
  • 效果:NVIDIA内部基准显示,相比单独使用Opus 4.8,Switchyard能在保持前沿准确率的同时,将任务完成成本降至近三分之一。
  • 合作伙伴案例
    • Boomi:路由准确率100%,59%流量转至5倍更快的微调模型,后期延迟降低21%。
    • Cadence:形式验证场景中效率提升9.9%。
    • Classmethod:内部测试实现27%成本降低,质量不变。
    • Cognition:集成至Devin Desktop,平均成本降低28%,接近前沿性能。
    • Kong:通过Kong AI Gateway原生支持。
    • LangChain:多轮任务成本降低74%,仅7%请求调用前沿模型,准确率牺牲6%。
    • LiteLLM:作为插件加入其代理层。
    • Nous Research:集成至Hermes系统。
    • Ramp:在SWE-Bench上保持前沿性能,成本降低58%,运行时间减少33%。
    • Siemens:正在评估以优化Fuse EDA AI Agent效率。

可用性

Nemotron 3.5 Lightning已可通过Hugging Face、ModelScope、OpenRouter和build.nvidia.com(NIM微服务)获取,并支持NVIDIA云合作伙伴生态。NeMo Switchyard已在GitHub开源,后续将登陆更多合作伙伴平台。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。