基元律动发布NeoHorse:将多模型执行经验转化为Agent原生能力
2026/09/08 10:14阅读量 15
华为诺亚方舟实验室前主任王云鹤创办的基元律动发布首个Agent-Native模型NeoHorse,旨在将多模型协作中的执行经验沉淀为模型参数。该模型通过“路由引导的课程学习”和On-Policy Distillation技术,利用Harness系统积累的失败与成功轨迹进行后训练。实测显示,4B版本在多项评测中达到或超越同规模SOTA基础模型,验证了从服务数据到模型能力的转化路径。
事件概述
基元律动(TokenRhythm)正式发布其首个大模型成果 NeoHorse。该模型由无问芯穹提供算力支持与Infra优化,清华大学、北京大学团队参与算法和训练方法研究。NeoHorse定位为 Agent-Native模型,重点解决Agent在工作流中调用工具、读取环境反馈、发现错误及调整路径等核心能力。
核心信息与技术路径
-
模型规格与性能:
- NeoHorse-1包含 4B 和 9B 两个版本。
- 在涵盖Harness Agent、工具使用、代码和指令遵循等10项评测中,经过Agentic Post-Training后,4B模型的综合表现已达到/略超9B基础模型水平。
- NeoHorse-1-4B的宏平均得分从58.94提升至64.87,在所有可对比基准上均超越其基础模型Qwen3.5-4B,并在4B同规模对比模型中综合领先。
-
数据来源:从Routing Harness到训练语料:
- 基元律动长期运营多模型协作系统 Routing Harness(开源项目OpenSquilla),积累了大量任务执行信号。
- NeoHorse的核心语料结合了Harness产生的Agent执行信号与公开数据。不同于传统问答数据仅关注“问题-答案”,Harness数据包含完整的执行轨迹:任务需求、能力判断、模型选择、推理过程、环境反馈、错误修复及最终结果。
- 这种横向的多模型表现数据,特别是“失败-修复”路径,为模型提供了关于“哪里容易出错”及“如何调整”的关键知识。
-
训练方法论:
- 数据筛选:对每条轨迹进行结构检查,并从完成目标、指令遵守、工具合理性、证据支撑、错误恢复、适时终止六个维度评估质量。
- Routing-Guided Curriculum(路由引导的课程学习):利用路由器估计的任务能力档位,安排样本顺序,先学习低难度任务,再逐步过渡到高复杂度轨迹。
- On-Policy Distillation(在线策略蒸馏):教师模型针对学生模型当前分布下实际遇到的问题进行指导,而非基于预设的标准错误集,使训练更贴合实际执行场景。
战略意义与商业闭环
-
验证RSI工程闭环:NeoHorse的发布验证了基元律动提出的递归自我改进(RSI)概念中的关键一环——Data-RSI。即系统积累的执行数据经过筛选后可进入训练池,更新后的模型再返回系统执行新任务,形成“执行-评估-训练-迭代”的闭环。
-
产品矩阵协同:
- OpenSquilla:开源版Routing Harness,降低多模型Agent开发门槛。
- TokenRhythm API:类似OpenRouter的统一接口平台,连接模型供给与调用需求。
- 企业级服务:面向金融、制造等行业提供私有部署与定制化服务。
- NeoHorse:自研模型,作为上述生态中沉淀经验的载体,旨在优化推理成本并提升特定任务下的稳定性。
-
未来挑战:尽管完成了单轮工程验证,但该系统仍面临开源生态转化率、高质量轨迹持续获取、多轮迭代增益持续性以及上游模型厂商垂直整合带来的竞争压力等挑战。
