NVIDIA发布Nemotron 3.5 Lightning与NeMo Switchyard,加速本地开源智能体
2026/08/11 21:00阅读量 2
NVIDIA于8月11日推出开放权重30B MoE模型Nemotron 3.5 Lightning,面向常驻智能体,token生成速度最高提升4倍,任务完成时间缩短30%。同时发布开源路由库NeMo Switchyard,自动将agent工作流各步骤路由至最优模型,在保持前沿任务完成效果的同时将基准成本降至约三分之一。
事件概述
NVIDIA宣布扩展Nemotron 3模型家族,推出开放权重的Nemotron 3.5 Lightning,该模型为30B参数MoE架构,专门用于本地“常驻智能体”场景。同日,NVIDIA还发布了开源路由库NeMo Switchyard,用于优化agent工作流中的模型选择。
核心信息
- 模型性能:与同类开源模型相比,Nemotron 3.5 Lightning的token生成速度最高提升4倍,任务完成时间缩短30%。开放权重允许开发者使用自己的数据微调,以匹配特定写作风格、专业领域或编码规范。
- 本地部署生态:NVIDIA与vLLM、Ollama、llama.cpp、LM Studio合作,提供NVFP4和GGUF格式的模型文件;Unsloth提供首日优化的量化版本。该模型可运行于NVIDIA RTX PC、DGX Spark、OEM GB10和Jetson设备,并可扩展至RTX PRO工作站、DGX Station、GB300等更高性能系统。
- NeMo Switchyard:该开源路由库根据准确性、速度和成本,将agent工作流的每一步自动分配给最合适的模型。内部基准显示,在保持前沿级任务完成效果的同时,路由策略可将基准完成成本降至仅使用Opus 4.8时的约三分之一。
- 获取方式:Nemotron 3.5 Lightning可通过OpenRouter、build.nvidia.com上的NIM微服务,以及NVIDIA云合作伙伴、后训练平台、推理平台和云服务提供商获取;NeMo Switchyard代码已发布于GitHub。
值得关注
NVIDIA此举将开源模型与智能体开发深度结合,既降低了个人和企业构建本地agent的门槛,也通过路由机制缓解了token成本压力。NVIDIA表示,未来几周还将在本地AI博客系列中陆续推出更多更新。
