基元律动韩凯:从多模型调度到反馈闭环,探索Agent持续进化

2026/09/22 18:06阅读量 2

在2026杭州云栖大会上,基元律动提出通过模型调度与RSI(递归式自我改进)闭环实现Agent持续进化的路径。其开源项目OpenSquilla在多模型协同下显著降低调用成本并提升任务表现;新发布的NeoHorse-1模型利用Agent运行经验进行后训练,小参数版本性能逼近大参数底座模型,验证了“应用反哺训练”的可行性。

事件概述

9月22日,在2026杭州云栖大会企业级Agent实践峰会上,基元律动联合创始人兼CTO韩凯发表演讲,探讨了在大模型长期异构并存、算力多元供给的背景下,如何通过优化模型调度与构建反馈闭环,推动Agent系统的持续进化。

核心信息

1. 多模型调度的必要性与成效

  • 背景挑战:随着Agent承担复杂任务,单次任务往往涉及十余次乃至数十次模型调用。任务表现不仅取决于模型本身,更依赖于模型选择、工具调用及上下文管理等系统能力。
  • 技术路径:基元律动通过开源项目OpenSquilla探索模型路由能力,旨在让每一步任务匹配最合适的模型,实现“用对模型、用得起模型”。
  • 实测数据
    • 在端到端Agent评测中,OpenSquilla保留了固定旗舰模型基线99.96%的任务质量,同时将成本降低88.9%。
    • 在DRACO深度研究评测中,多模型协同配置得分超过最强单模型基线,成本约为其三分之一。

2. RSI反馈闭环与模型迭代

  • 机制定义:面向RSI(Recursive Self-Improvement,递归式自我改进),建立以场景能力需求为牵引的闭环:通过评测识别模型与调度策略的改进方向 -> 开展针对性优化 -> 将升级后的能力应用于场景验证。
  • 初步验证成果:9月发布的NeoHorse-1系列模型基于通义Qwen3.5底座完成后训练,展示了利用Agent运行经验改进模型的可行性。
    • 性能提升:4B版本宏平均得分由58.94提升至64.87;9B版本由65.60提升至69.04。
    • 越级表现:4B后训练版本在VitaBench、τ²-Bench、PinchBench、QwenClawBench和HumanEval五项评测中超过Qwen3.5-9B底座模型,整体平均得分进一步接近9B底座水平。

3. 生态合作与基础设施

  • 模型接入:基元律动与阿里云围绕Qwen系列开展场景测试与应用验证,并在自身Harness与Agent产品中持续使用模型、积累反馈,推动新版本接入TokenRhythm路由平台。
  • 算力支持:无问芯穹为NeoHorse-1的训练与推理提供算力支持及基础设施优化;阿里云为相关业务运行提供云服务支持。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。