基元律动发布NeoHorse模型:基于Harness执行轨迹的RSI路径探索
2026/09/08 14:31阅读量 2
基元律动联合无问芯穹、清华北大及阿里等机构,推出首个Agent-Native模型NeoHorse-1(含4B/9B版)。该模型以Routing Harness产生的Agent执行轨迹为核心语料,通过递归自我改进(RSI)机制进行后训练。评测显示,NeoHorse 4B在多项基准上表现优异,部分指标超越Qwen3.5-9B底座,验证了利用Agent反馈优化模型能力的技术路线。
事件概述
基元律动(TokenRhythm)近日发布技术报告,宣布推出首个Agent-Native模型 NeoHorse-1。该项目由基元律动联合无问芯穹、清华大学、北京大学、阿里巴巴等机构共同完成,包含4B和9B两个版本。其核心创新在于将Agent在使用工具、接收反馈和修正错误过程中的经验转化为模型能力,探索了一条基于Harness驱动的递归自我改进(RSI)路径。
核心技术与训练方法
- 数据源与语料构建:训练语料主要来源于基元律动此前开发的开源Routing Harness系统 OpenSquilla 所产生的执行轨迹。这些轨迹保留了能力需求预测、路由选择、模型响应、工具调用和环境反馈等关键信息。经过完整性检查及目标完成度、证据一致性、错误恢复等质量评估后,用于模型的后训练。
- 训练流程:团队利用路由信号估计任务所需能力并安排训练顺序,结合Agent执行监督和在策略蒸馏(On-Policy Distillation)更新模型。在策略蒸馏中,教师模型针对学生模型实际生成的内容提供指导。
- 基础设施支持:无问芯穹提供了模型算法与芯片硬件协同优化的基础设施支持,提升了训练效率并优化成本;清华和北大团队参与了算法和训练方法的创新,旨在推动更陡峭的训练Scaling曲线。
- 底座模型:NeoHorse分别基于阿里巴巴开源的 Qwen3.5-4B 和 Qwen3.5-9B 进行后训练。
评测结果与分析
报告在11项涵盖Agent执行、工具交互、代码和指令遵循的基准上进行了评测。主要发现如下:
- 性能表现:在4B级别模型中,NeoHorse 4B的未加权平均分最高。它在五项基准测试中超过了 Qwen3.5-9B 底座模型。
- 优势领域:改善主要集中在流程清晰、反馈可观察、结果可验证的任务上。
- 局限性:更大规模的模型在复杂状态维护、长程调试和失败恢复方面仍具有优势。
意义与展望
这一过程被视为递归自我改进(RSI)的单轮工程验证:通过Agent执行暴露能力短板,调整训练选择,使模型完成更新并重新返回Harness循环。对于基元律动而言,NeoHorse为其“Harness与模型协同改进”的技术设想提供了模型层面的证据,也为后续让开源模型进一步学习任务执行中的经验奠定了基础。
