NVIDIA发布Nemotron 3.5 Lightning与NeMo Switchyard,加速本地开源智能体

2026/08/11 21:00阅读量 2

NVIDIA于8月11日推出开放权重30B MoE模型Nemotron 3.5 Lightning,面向常驻智能体,token生成速度最高提升4倍,任务完成时间缩短30%。同时发布开源路由库NeMo Switchyard,自动将agent工作流各步骤路由至最优模型,在保持前沿任务完成效果的同时将基准成本降至约三分之一。

事件概述

NVIDIA宣布扩展Nemotron 3模型家族,推出开放权重的Nemotron 3.5 Lightning,该模型为30B参数MoE架构,专门用于本地“常驻智能体”场景。同日,NVIDIA还发布了开源路由库NeMo Switchyard,用于优化agent工作流中的模型选择。

核心信息

  • 模型性能:与同类开源模型相比,Nemotron 3.5 Lightning的token生成速度最高提升4倍,任务完成时间缩短30%。开放权重允许开发者使用自己的数据微调,以匹配特定写作风格、专业领域或编码规范。
  • 本地部署生态:NVIDIA与vLLM、Ollama、llama.cpp、LM Studio合作,提供NVFP4和GGUF格式的模型文件;Unsloth提供首日优化的量化版本。该模型可运行于NVIDIA RTX PC、DGX Spark、OEM GB10和Jetson设备,并可扩展至RTX PRO工作站、DGX Station、GB300等更高性能系统。
  • NeMo Switchyard:该开源路由库根据准确性、速度和成本,将agent工作流的每一步自动分配给最合适的模型。内部基准显示,在保持前沿级任务完成效果的同时,路由策略可将基准完成成本降至仅使用Opus 4.8时的约三分之一。
  • 获取方式:Nemotron 3.5 Lightning可通过OpenRouter、build.nvidia.com上的NIM微服务,以及NVIDIA云合作伙伴、后训练平台、推理平台和云服务提供商获取;NeMo Switchyard代码已发布于GitHub。

值得关注

NVIDIA此举将开源模型与智能体开发深度结合,既降低了个人和企业构建本地agent的门槛,也通过路由机制缓解了token成本压力。NVIDIA表示,未来几周还将在本地AI博客系列中陆续推出更多更新。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。