EverMind三篇论文完整披露自进化AI技术栈,覆盖Harness、Skill与模型权重

2026/08/08 15:56阅读量 2

EverMind以三篇论文分别解决Agent脚手架自改进、技能库规模化管理和模型权重训练信号分配问题,覆盖从任务层到模型层再到元改进层的完整自进化路径。论文实验显示,HarnessBank在7个基准上提升5.1%–15.4%,SkillCorpus将约82.1万个原始技能筛选为9.6万个高质量技能,DASH在数学推理基准上刷新对比方法最高分。

事件概述

EverMind是盛大集团孵化、延续盛大创新院研究基因的AI研究团队,方向聚焦长期记忆与自进化AI。团队近期连续发布三篇论文,分别从技能层、脚手架层和模型权重层给出了一套自进化AI技术方案。

同期海外NeoLab浪潮中,Recursive Superintelligence、Engram、Adaption Labs、Core Automation等团队获得了高额融资或高估值,但多数仍停留在单点理论探索阶段,尚未公开完整方案或论文。EverMind的三篇论文则试图覆盖自进化的完整路径。

三篇论文核心

1. HarnessBank:让Agent安全改写自身脚手架

HarnessBank对应论文 arXiv:2607.13683,目标是让Agent自主诊断失败并重写运行逻辑,同时解决自改进中的过拟合问题。

核心创新是将“提出变更”与“归因变更”分离:语言模型只负责诊断失败原因并提出补丁,采样、测量和显著性检验全部交给确定性代码逻辑完成。系统引入“装备基因库”(Harness Gene Bank),以“WHERE × WHY”语义坐标存储高性能脚手架,支持通过故障诊断“重新发明”或跨单元“机制重组”。

实验以Qwen3.6-27B作为任务Agent、Claude Opus 4.8作为进化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七个基准上与GEPA、DGM对比,冻结任务Agent权重的情况下取得5.1%到15.4%的一致性能提升,且增益均通过配对显著性检验(z≥1.96)。

跨模型实验还发现,最优脚手架随模型“主导病理”变化,但“诊断—归因”机制可跨模型迁移,说明这套能力属于可迁移的元能力。

2. SkillCorpus:10万技能库的聚合与检索

SkillCorpus对应论文 arXiv:2607.15557,针对开源Skill.md技能生态的碎片化、冗余和质量不均问题。

团队从爬取的约82.1万个原始技能中,经多阶段策略筛选出96401个高质量技能,建立16个类别分类法,并从实用性、鲁棒性、安全性三个维度进行质量控制。配合专门微调的检索与选择技术栈,Raven Harness集成SkillCorpus后,在SkillsBench、GDPVal、QwenClawBench三个基准上均获得稳定提升,其中SkillsBench上最大提升7.5个百分点。

论文还识别出技能增益的边界:覆盖边界(技能库是否覆盖任务所需知识)和Harness边界(脚手架能否有效调用技能)。技能并非静态资产,EverOS会根据任务执行成败持续打磨技能,用得好的被强化复用,用得差的被修正淘汰。

3. DASH:优化模型权重层自蒸馏监督

DASH对应论文 arXiv:2608.06243v1,解决同策略自我蒸馏(OPSD)中监督信号均匀分配、忽略错误时序上下文的问题。

DASH将每个局部蒸馏信号与序列级均值的差距转化为自适应传播门,控制向后多步聚合:局部散度高于序列均值时视为高风险分叉点,打开更大传播门;反之收窄传播门,避免无关步骤干扰学习。

在AIME 2024、AIME 2025、HMMT 2025三个数学推理基准上,DASH在Qwen3-1.7B、Qwen3-4B、Qwen3-8B上均取得对比方法最高分。Qwen3-1.7B平均分从vanilla OPSD的41.87提升至45.07,Qwen3-8B从65.00提升至66.40,且无需额外前向传递开销。

自进化框架与验证

EverMind将自进化路径概括为四层递进体系:

  • 任务层:优化单次任务执行质量,包括记忆提取/回写与技能沉淀复用,对应EverOS与SkillCorpus。
  • 脚手架层:优化Agent外围Code与Policy,通过Eval与Reflection驱动版本迭代,对应Raven框架与HarnessBank。
  • 模型层:利用高价值轨迹、偏好和失败样本进行LoRA等验证后灰度更新,对应DASH所支撑的底层训练优化。
  • 元改进层:优化Evaluator、Data与Training Recipe本身,让下一轮进化更快、更可靠。

团队还在今年4月发布面向Agent自进化的评测基准EvoAgentBench,当月为Hugging Face同类benchmark下载量第一。过去一年,团队在长期记忆与自进化领域累计产出9篇论文,其中数篇被ACL、KDD等顶会录用。

值得关注

EverMind的路线不是单一技术点,而是“三层并发”的全栈生态:EverOS负责非参数化长期记忆,Raven负责Harness自进化,DASH负责底层权重训练优化,并坚持开源优先。与海外NeoLab多停留在理论探索相比,其完整技术栈和开源生态是主要差异点。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。