开源Harness冲击闭源RSI叙事:18个Agent自主科研,Kimi K3逼近Opus 5

2026/08/20 17:46阅读量 25

Prime Intellect用多智能体Harness让18个前沿模型自主优化nanoGPT训练,开源模型Kimi K3以2930步的成绩超过GPT-5.6 Sol,逼近Opus 5的2920步。实验显示,在AI科研中试错吞吐量比idea本身更关键,开源模型加Harness可能改变“最强闭源模型赢家通吃”的RSI剧本。

事件概述

Prime Intellect在一项新研究中测试了多智能体Harness在自主AI科研中的作用。他们将18个前沿模型放入nanoGPT优化任务,要求模型自主完成从提出假设、修改代码、运行训练到验证结果的全流程,目标是尽可能少的训练步数将1.24亿参数GPT的验证集loss降至3.28以下。实验统一运行在8张H200上,全程断网并放入sandbox,人类基本不介入。

实验从3290步的baseline出发,公开的人类最佳纪录为2600步。最终成绩:Fable 5以2726步领先,相当于吃掉了从baseline到人类纪录之间690步优化空间中的564步(约82%);Kimi K3搭配Prime Agent Harness跑出2930步,超过GPT-5.6 Sol的3042步,距Claude Opus 5的2920步仅差10步。

核心信息

Prime Intellect共完成153次全自主实验,单次最长超过8天。他们发现,没有任何一次实验提出真正全新的方法,有效的normalization、学习率调整、权重平均和optimizer技巧都已有类似研究。真正的差距体现在实验执行层面:强模型更少过早否定一个方向,更善于判断小提升是真实信号还是噪声,还会主动制造工具。

例如Kimi K3会自己编写实验函数、比较loss曲线、恢复baseline,并搭建小型数值实验室先验证Newton-Schulz再带回真实训练。

值得关注

这一结果意味着,至少在类似研究任务中,idea本身可能并不稀缺,科研能力更像一个试错吞吐量问题。Prime Intellect因此强调Multi-Agent Harness的价值:用更便宜的开源模型负责监控和实现,把关键判断留给更强模型,从而以同样成本跑更多实验。他们下一步计划把Speedrun扩展到训练栈更多环节并继续扩大实验规模。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。