Agent后训练新范式:从任务执行到自主发现,探索下一个Scaling Law
2026/09/12 16:40阅读量 3
在2026 Inclusion·外滩大会上,多位专家探讨了智能体(Agent)后训练的核心议题,指出衡量标准正从“完成任务”转向“自主发现”。研究重点涵盖多智能体协作、真实场景下的专业化执行、轻量化强化学习框架以及长程任务的自动化管理。通过构建可交互的训练环境与数据闭环,旨在推动模型从静态知识复现走向动态自我进化与科学创新。
Agent后训练:寻找能力进化的新路径
随着大模型逐渐具备调用工具和执行复杂任务的能力,其能力评估标准正在发生根本性转变:不仅关注能否给出正确答案,更看重在真实环境中持续行动、检查结果并根据反馈调整策略的能力。2026年9月12日,在“Inclusion·外滩大会”上,来自学术界和产业的专家围绕“Agent Post-Training”展开讨论,揭示了从完成任务到自主发现的演进逻辑。
核心维度:数量、环境与进化
CAMEL AI创始成员谢钰溱提出,探索Agent的Scaling Law需聚焦三个维度:
- 数量:重点在于解决多智能体间的通信、共识达成及无中心化控制下的自组织问题,而非单纯增加数量。
- 环境:环境是Agent能力的训练场。随着任务复杂度提升(如跨设备操作、机器学习研发),需专门构建能验证结果并防止奖励机制被滥用的复杂环境。
- 进化:关键在于Agent能否在工作中积累经验、发现不足并提出新思路,从而加速下一代模型的训练。
产业化实践:走出实验室的专业化执行
蚂蚁百灵大模型负责人周俊强调,Agent在医疗、金融等垂直领域的落地需满足三个条件:
- 高质效:综合平衡任务质量、成本、等待时间与成功率。
- 可专业化:模型需理解专业语境、使用专业工具并遵循工作流,而不仅是补充知识。
- 可信执行:建立风险识别与边界限制体系,在证据不足或风险过高时主动请求人工介入,而非假设模型不会犯错。
他同时指出,真实场景既是检验考场也是训练场,需沉淀可复盘的失败案例和交互式训练环境以反哺模型改进。
基础设施与研究效率
针对Agent训练日益复杂的问题,英伟达研究员胡健介绍了轻量级强化学习框架Molt:
- 设计目标:降低框架理解与修改成本,缩短从想法到实验的距离。核心代码约9000行,基于PyTorch原生能力。
- 支持Agent参与研发:简洁的代码结构有助于编程智能体理解训练框架,减少实现错误。
- 技术特性:支持外部Agent接入、长任务上下文压缩处理,以及流式采样以提高GPU利用率。
美团LongCat团队负责人顾奇则关注长程任务中的环境、信息管理与训练的协同:
- 任务分类:分为循环迭代型(依赖稳定工具链和即时反馈)和系统性任务(依赖长周期、稀疏反馈)。后者需引入任务分段、过程指导和中途更新机制。
- Harness设计:包括交互界面、信息管理机制和推理脚手架。未来趋势是模型自身掌握更多能力,但环境交互与信息管理仍需长期存在,需与训练目标共同设计。
具体场景应用:长视频生成与自主科研
- 长视频生成:新加坡国立大学博士生孙彦指出,长视频制作需将规划与校验前置。通过将影视制作经验转化为结构化流程,分离剧本(观众视角)与制作方案(实现视角),并构建生成依赖图进行并行制作与局部返修,以解决角色一致性和叙事连贯性问题。
- 自主科研:清华大学助理教授陈勇超认为,衡量模型应关注其在陌生环境中发现新知识的能力。团队通过让AI参与数据与研究轨迹生成,形成“数据-能力”迭代闭环,但仍面临思维多样性不足和成果验证瓶颈。
- 递归自我改进(RSI):上海交通大学副教授陈思衡展示了基于35B模型的后训练成果,其在前沿科学评测得分显著提升,并观察到能力向通用任务迁移。他强调需构建包含知识库、代码库等的科研环境,形成“智能体—环境—数据—模型”的循环。KAUST博士诸葛鸣晨回顾了RSI脉络,指出当前实践借助实验反馈判断改进有效性,并呼吁在推进自我改进的同时关注安全问题。
圆桌共识:SFT与RL的分工及未来方向
在圆桌讨论中,嘉宾们就RSI路径和训练方法达成部分共识:
- SFT与RL分工:监督微调(SFT)用于帮助模型获得初步的环境探索能力;当模型具备基础后,提升主要依靠强化学习(RL)中的自主尝试与环境反馈。高质量环境和反馈信号在RL阶段至关重要。
- 突破点:各方普遍认为,未来的突破在于提供能提供新知识的环境、完善的评价机制,以及让系统自主探索前沿问题,逐步减少对人工指导的依赖。
