具身智能新范式:清华于超团队提出 Harness VLA,走向“模型+系统”协同

2026/08/05 12:15阅读量 2

清华于超团队提出 Harness VLA,探索“模型+系统”协同的具身智能新范式:在 VLA 外增加 Harness Layer 并与 code policy agent 结合,让系统自主分配精细操作与长程任务,在 LIBERO-Pro 上以 zero-shot 方式实现超 80% 成功率。团队同时提出机器人本体数量作为独特规模化维度的 Scaling Law,并预测未来五年具身基模将真正具备泛化性。

事件概述

清华于超团队提出 Harness VLA,将广义 VLA 不再作为纯端到端执行器,而是在模型外围增加 Harness Layer,并与 code policy agent 结合。系统可自主分配任务:VLA 负责局部接触丰富、需要精细操作的任务(如抓取、插入),code policy agent 负责长距离移动、失败重试等长程逻辑。在 LIBERO-Pro 基准上,该方案以 zero-shot 方式取得超过 80% 的成功率,为已知最高分。

核心判断

  • 具身智能存在独特 Scaling Law:除模型与数据规模化外,机器人本体数量是额外的规模化维度。团队正在真实世界搭建基础支撑大规模在线交互,探索模型与机器人数量双重规模化能否带来泛化能力进一步增长。
  • 强化学习是 VLA 中不可替代的训练算法:强化学习不属于与其他路线竞争的范式,而是训练模型的算法。它在 VLA 中的核心作用是产生交互数据,从中学习重力、摩擦力、质量等物理世界运行规律,使决策达到 100% 可靠,这是模仿学习无法替代的。
  • 未来五年基模将真正具备泛化性:当前行业存在基模过拟合问题,但已被认知,五年内会出现更好的基模与更合理的数据使用方式。

落地进展

于超联合发起的正行创新(Striding AI)已与重要伙伴建立战略合作,部分结构化工业场景中模型落地相对成熟。团队当前预研两个方向:隐世界模型预训练,以及具身 Agent Infra(Harness VLA 相关)。公司计划先进入零售与工业场景形成早期数据飞轮,再逐步扩大落地范围,探索通用能力。

背景

于超现任清华大学深圳国际研究生院具身决策智能实验室助理教授,也是正行创新联合发起人。此前代表作包括多智能体强化学习算法 MAPPO,以及面向具身大模型的强化学习训练框架 RLinf(已被英伟达 Isaac Lab 收录)。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。