RISED:基于评分量表的智能体多环境选择与自蒸馏方法
2026/10/06 08:00阅读量 4
Apple Machine Learning Research 提出 RISED,旨在解决单一大语言模型(LLM)智能体在多样化交互环境中联合训练时,传统基于标量奖励的数据选择策略存在的局限性。该方法利用预定义的量表词汇对轨迹进行标记,生成行为画像以指导在线数据选择和策略监督,并通过正负量表实现自蒸馏和失败模式规避。实验表明,RISED 在不同模型骨干网络上均取得了最高的平均通过率,并在各个独立环境中排名第一或第二。
事件概述
针对单一大型语言模型(LLM)智能体在多种交互式环境中联合训练以构建通用智能体的趋势,现有课程学习和数据选择策略通常仅在环境层面分配训练资源,或优先依赖局部基于奖励的信号。这些方法未显式考虑跨环境当前轨迹之间的关系,导致当不同环境学习速率不同时,批次中可能同时存在全失败和全成功的轨迹组,使得缺乏组内相对奖励信号的数据无法有效利用。此外,仅依赖标量奖励在多环境强化学习中存在信息不足的问题,既无法提供跨环境关系的详细信息,也无法在奖励相同时提供组内的奖励对比。
核心机制:RISED 框架
为解决上述问题,研究团队提出了 RISED(Rubrics for Agentic Multi-Environment Selection and Self-Distillation),将丰富的文本反馈(即“量表”,Rubrics)不仅用作奖励,还用于指导在线数据选择和策略监督。其核心组件包括:
- 轨迹标记与画像生成:使用一个 LLM 裁判(LLM judge),基于跨环境共享的预定义量表词汇库,对每条轨迹(rollout)进行标记。生成的画像用于引导数据选择,确保所选数据符合混合环境批次的整体行为构成,同时限制与已选数据的重叠。
- 正向量表指导自蒸馏:描述期望行为的正向量表为基于策略的自蒸馏教师模型提供特权上下文,补充额外的 token 级监督信号。
- 负向量表规避失败模式:描述非期望行为的负向量表指导后续的轨迹生成,帮助智能体避开重复出现的失败模式。
实验结果与分析
- 性能表现:在不同模型骨干网络(model backbones)上,RISED 实现了各环境中最高的平均通过率(mean pass rate),并在每个单独环境中均排名第一或第二。
- 行为分析:基于量表的分析进一步揭示了伴随性能提升而发生的行为变化特征,验证了该方法在细粒度行为控制上的有效性。
背景与作者
- 发布时间:2026年10月
- 作者团队:Jingtan Wang, Sirajul Salekin, Young mok Jung, Javier Movellan, Bryan Kian Hsiang Low, Manjot Bilkhu。
- 机构关联:部分工作由 Apple 支持,Jingtan Wang 和 Bryan Kian Hsiang Low 隶属于新加坡国立大学。
- 相关领域:数据科学与标注、语音与自然语言处理。
该研究通过引入结构化文本反馈(量表),突破了传统标量奖励在多环境智能体训练中的瓶颈,为通用智能体的高效训练提供了新的数据选择和监督范式。
