Apple发布SCLATE:面向持续学习智能体的统一训练与评估框架
2026/09/30 08:00阅读量 2
Apple Machine Learning Research推出SCLATE,旨在解决持续学习智能体在多会话场景中缺乏统一调度机制的问题。该框架通过混合模拟时钟和适配器接口,将基准测试事件与智能体内部状态(如记忆巩固)整合至共享时间线,大幅压缩训练耗时。实验表明,经过SCLATE微调的Qwen3.5-4B模型在代码生成任务中显著提升了性能,且揭示了不同模型对记忆系统利用方式的差异。
事件概述
Apple Machine Learning Research于2026年9月发布了论文《SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation》。针对当前持续学习(Continual-Learning)智能体在长周期多会话训练中面临的调度难题,研究团队提出了一种名为SCLATE的执行基底(Execution Substrate)。该框架允许未修改的智能体和基准测试通过适配器向单一开放事件调度器添加事件,从而实现对复杂交互流程的统一管理。
核心技术与机制
- 统一事件调度:现有基准通常仅调度自身事件,导致每个基准与智能体的组合需定制复杂的调度循环。SCLATE通过适配器让基准和智能体各自注册事件,由一个共享的事件调度器统一管理。
- 混合模拟时钟(Hybrid Simulated Clock):该时钟在共享时间线上运行事件,支持实时流式处理并跳过空闲间隙。这种机制能将长达一个月的场景模拟压缩至数小时内完成,显著提升训练效率。
- 无侵入式记录引擎:SCLATE作为 rollout 引擎,可在不修改智能体 harness 和 memory 的情况下运行任何智能体。它通过容器内代理(in-container proxy)记录每次模型调用的 token 和 log probabilities,便于后续分析。
实验与关键发现
研究团队将七个基准移植到 SCLATE,并在十个模型上对比了十种未修改的 harness 和 memory 配置,得出以下结论:
- 记忆系统的有效性:额外添加的记忆系统并不总能优于 harness 自带的原生记忆,其效果高度依赖于具体配置。
- 模型差异性:不同模型在使用相同的 harness 和 memory 时表现出巨大的行为差异,表明模型架构对持续学习能力的制约作用。
模型微调成果
基于 SCLATE 框架,研究人员对 Qwen3.5-4B 模型进行了后训练(Post-training),使用未修改的 harness 和 memory 系统进行优化。结果显示:
- 效率提升:模型读取的文件行数减少了 6.8 倍。
- 准确率提高:在 SWE-bench Verified 测试集上的通过率提升了 16.7 个点。
- 记忆质量:模型生成了更丰富的记忆记录。
- 泛化能力:在 MetaClaw 保留数据集上的准确率最高提升了 11.8 个点。
这些结果表明,SCLATE 不仅为持续学习智能体提供了标准化的训练和评估环境,还有效验证了通过结构化记忆和高效调度提升大模型代码生成能力的可行性。
