清华与英伟达提出VLM-AR3L框架:双奖励机制破解具身智能大模型评估难题
国立清华大学与NVIDIA联合团队发布研究,评估Gemini、GPT等主流视觉语言模型(VLM)在《我的世界》等具身任务中的动作评估能力。研究发现虽然Gemini综合表现最佳,但直接调用云端大模型进行强化学习打分面临高昂成本和算法缺陷。为此,团队提出VLM-AR3L框架,通过“绝对+相对”双奖励机制及离线蒸馏技术,将API查询频次降低20倍,并在长时程任务中超越人类手写奖励。
事件概述
国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,针对具身智能领域视觉语言模型(VLM)的动作评估能力进行了系统性测试,并提出了名为 VLM-AR3L 的新框架,旨在解决大模型在强化学习(RL)中应用时的成本高昂与评估失效问题。
核心信息
1. VLM 具身评估能力横向实测
研究团队选取了涵盖四大仿真套件的 10 个典型任务,包括基础刚体平衡(Cart Pole)、柔体操作(拉直绳索、倒水)、机械臂接触控制(开抽屉)以及《我的世界》中的复杂多步逻辑任务(击杀蜘蛛、挤牛奶等)。评测规则为:剥离上帝视角数据,仅基于第一人称 RGB 画面和自然语言目标,判断前后两个时刻哪个状态更接近任务目标。
- Gemini-2.0-Flash 综合领跑:是唯一在所有 10 项任务中准确率均保持在 70% 以上的模型。在 Cart Pole 任务中达到 91%,在 MetaWorld 机械臂任务中稳定在 84%~87%,能敏锐捕捉微观物理变化。
- GPT-4.1 表现平平:GPT-4.1-nano 在多数任务中准确率仅在 60%~66% 徘徊,对复杂空间时序变化判断力不足。
- 传统对比模型失灵:CLIP/MineCLIP 等传统依赖向量余弦相似度的模型彻底低迷,MineCLIP 在 MineDojo 任务中准确率仅为 39%~59%,证明缺乏高阶推理能力的特征匹配模型难以理解连续动作进展。
- 开源小模型局部爆发:Phi-3.5-Vision-Instruct 在《我的世界》“挤牛奶”和“剪羊毛”任务中达到 90% 准确率;DeepSeek-VL2-Tiny 在高动态战斗场景中得分 85%;MiniCPM-o-2.6 在液体状态识别任务中做出 73% 的精准裁决。
2. 直接应用大模型的两大瓶颈
尽管 VLM 具备出色的判断力,但在实际强化学习落地中面临严峻挑战:
- 成本与延迟灾难:强化学习需数十万至百万步交互,若每步调用云端 API,单次训练成本可达数万美元,且网络延迟会使训练速度降低数十倍。
- 算法逻辑缺陷:
- 评分漂移:随着训练推进,智能体探索新场景,单图绝对打分的基准会发生剧烈波动,导致奖惩信号不一致。
- 循环任务失效:对于存在非线性或循环动作的任务(如环形跑道巡逻),由于状态无全局固定先后顺序,绝对奖励会导致智能体收益始终为 0,陷入死循环。
3. VLM-AR3L 架构解法
为突破上述瓶颈,团队提出 VLM-AR3L 框架,核心创新在于“双奖励融合”与“轻量蒸馏”:
- 绝对+相对双奖励机制:
- 绝对奖励:评估单个状态离目标的远近,提供全局方向感。
- 相对奖励:比较当前状态 $s_t$ 与过去某一步 $s_{t-k}$ 的变化,判断单步是进步还是退步。为防止幻觉,设置双向对称置信度检验,仅当模型高度确信当前优于过去时才发放正向奖励。
- 两者归一化后结合,兼顾全局方向与微观步骤推进。
- 离线打标与孪生网络蒸馏:
- 后台异步打标:大模型仅在后台定期从经验回放池采样图像对生成偏好标签,不介入实时训练。
- 前台本地替代:使用离线标签训练极小的孪生网络,智能体在前台策略训练时直接调用本地轻量网络获取奖励。
- 效果:该工程优化将 VLM 的 API 查询需求降低约 20 倍,显著降低成本和延迟。
4. 实战效果
在《我的世界》等复杂具身场景中,VLM-AR3L 表现优异:
- 在 Combat Spider(85%成功率)、Milk Cow(95%成功率)等任务上实现高成功率收敛,远超基线方法 RL-VLM-F。
- 在挤牛奶、剪羊毛等极度依赖长时程探索的任务中,凭借密集稳定的相对进展信号,成功引导智能体学会完整流程,表现甚至超越了人类工程师精心手写的稀疏真值奖励(后者因反馈稀疏导致成功率为 0)。
值得关注
该研究确立了具身智能时代的一种新分工范式:通用 VLM 无需亲自操盘底层电机控制或毫秒级响应,而是作为“总教官”扮演高屋建瓴的角色,负责评判进展和离线打标,并将感知能力蒸馏给轻量化、端到端的策略小模型。这为具身智能迈向高可靠、低成本落地提供了清晰的技术路径。
