基元律动韩凯:从多模型调度到反馈闭环,探索Agent持续进化
2026/09/22 18:06阅读量 2
在2026杭州云栖大会上,基元律动提出通过模型调度与RSI(递归式自我改进)闭环实现Agent持续进化的路径。其开源项目OpenSquilla在多模型协同下显著降低调用成本并提升任务表现;新发布的NeoHorse-1模型利用Agent运行经验进行后训练,小参数版本性能逼近大参数底座模型,验证了“应用反哺训练”的可行性。
事件概述
9月22日,在2026杭州云栖大会企业级Agent实践峰会上,基元律动联合创始人兼CTO韩凯发表演讲,探讨了在大模型长期异构并存、算力多元供给的背景下,如何通过优化模型调度与构建反馈闭环,推动Agent系统的持续进化。
核心信息
1. 多模型调度的必要性与成效
- 背景挑战:随着Agent承担复杂任务,单次任务往往涉及十余次乃至数十次模型调用。任务表现不仅取决于模型本身,更依赖于模型选择、工具调用及上下文管理等系统能力。
- 技术路径:基元律动通过开源项目OpenSquilla探索模型路由能力,旨在让每一步任务匹配最合适的模型,实现“用对模型、用得起模型”。
- 实测数据:
- 在端到端Agent评测中,OpenSquilla保留了固定旗舰模型基线99.96%的任务质量,同时将成本降低88.9%。
- 在DRACO深度研究评测中,多模型协同配置得分超过最强单模型基线,成本约为其三分之一。
2. RSI反馈闭环与模型迭代
- 机制定义:面向RSI(Recursive Self-Improvement,递归式自我改进),建立以场景能力需求为牵引的闭环:通过评测识别模型与调度策略的改进方向 -> 开展针对性优化 -> 将升级后的能力应用于场景验证。
- 初步验证成果:9月发布的NeoHorse-1系列模型基于通义Qwen3.5底座完成后训练,展示了利用Agent运行经验改进模型的可行性。
- 性能提升:4B版本宏平均得分由58.94提升至64.87;9B版本由65.60提升至69.04。
- 越级表现:4B后训练版本在VitaBench、τ²-Bench、PinchBench、QwenClawBench和HumanEval五项评测中超过Qwen3.5-9B底座模型,整体平均得分进一步接近9B底座水平。
3. 生态合作与基础设施
- 模型接入:基元律动与阿里云围绕Qwen系列开展场景测试与应用验证,并在自身Harness与Agent产品中持续使用模型、积累反馈,推动新版本接入TokenRhythm路由平台。
- 算力支持:无问芯穹为NeoHorse-1的训练与推理提供算力支持及基础设施优化;阿里云为相关业务运行提供云服务支持。
