清华系星动纪元VPP2登顶全球具身智能榜首:解耦视频预测与动作学习

2026/10/09 11:52阅读量 24

清华大学旗下星动纪元发布的自研世界动作模型VPP2,在RoboDojo仿真榜单中综合得分与成功率均位列全球第一,超越GPT-6-Astra等头部模型。该模型通过“视频预测”与“动作学习”分阶段训练的解耦策略,在不依赖额外数据或外挂增强手段的情况下,显著提升了机器人在泛化、精细操作及记忆维度的能力。实测显示,VPP2在真实ALOHA机器人上的零样本操作成功率达58.5%,并验证了“高层规划+底层执行”的物理AI新范式潜力。

事件概述

近日,由清华大学唯一持股的具身智能公司星动纪元(StarDynamics)发布的自研世界动作模型VPP2,在具身智能领域权威评测基准RoboDojo中取得优异成绩。VPP2以综合平均成功率32.26%、综合平均得分39.26分的成绩登顶全球第一,超越了包括OpenAI的GPT-6-Astra、Physical Intelligence的π0.5以及英伟达GR00T-N1.7在内的全球头部具身模型。

值得注意的是,VPP2并未使用额外的训练数据,也未采用Agent RSI等增强手段,仅依靠标准数据集和预训练基座的强大泛化能力便实现了性能突破。此外,该模型已在开源代码库中发布,供社区复现与研究。

核心信息与技术突破

1. RoboDojo评测表现:全面领先

RoboDojo是由香港大学MMLab牵头,联合全球近20所顶尖学术机构建设的仿真评测平台,旨在测试机器人在非结构化环境中的泛化能力。其包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆及开放词汇指令理解五个维度。

  • 综合成绩:VPP2在综合平均成功率和平均得分上均居首位。
    • VPP2:成功率32.26%,得分39.26分。
    • GPT-6-Astra:成功率22.48%,得分28.97分。(VPP2分别领先9.78个百分点和10.29分)
  • 分项能力:在泛化能力、精细操作、记忆能力三个关键维度上,VPP2均拔得头筹。
  • 真机迁移验证:将VPP2部署至真实ALOHA双臂机器人进行零样本操作测试(无需微调),涵盖抓取、放置、堆叠等10类任务,平均成功率达到58.5%,高于对比模型π0.5的40%,并在10类任务中拿下9类最佳成绩。

2. 技术路线:视频预测与动作学习的“解耦”与“排序”

传统世界动作模型(WAM)常面临“视频预测准确但动作执行偏差”或“加入动作训练后破坏原有泛化能力”的问题。VPP2的核心创新在于将视频预测与动作学习分为两个阶段处理,具体实施了三阶段训练策略:

  • 第一阶段:事件级视频继续预训练

    • 基于阿里开源的Wan2.1-I2V-14B模型,整合机器人操作、人类活动等多源数据。
    • 数据精细化:将操作过程切分为语义完整的片段,并提供包含机械臂、物体、盒子等细节的详细描述,建立语言指令与物理操作的稳定对应关系。
    • 长程预测:让模型学习从开始到结束的完整操作过程,而非仅预测下一帧。在指令遵循测试中,14B参数的VPP2成功率达90%,优于64B参数的Cosmos3模型(78%)。
  • 第二阶段:固定时长视频后训练与蒸馏

    • 为解决推理速度问题,将事件级预测调整为固定8秒的视频片段预测。
    • 通过一致性蒸馏,将多步计算压缩为单步生成,使预测未来8秒视觉变化的耗时降至约0.12秒。
  • 第三阶段:动作专家训练

    • 引入一个0.9B参数的扩散Transformer(Action DiT,采用MoT架构)作为动作专家,负责根据预测的未来状态生成机器人动作。
    • 冻结策略:在动作训练初期,冻结视频模型的基础参数,仅通过LoRA进行适配,防止动作学习破坏已建立的预测泛化能力。
    • 整体延迟:视频预测(0.12s)+ 动作生成(0.1s)= 整体动作片段生成延迟约0.22秒。

3. 泛化能力验证

除了RoboDojo,VPP2在其他基准测试中也展现了强大的泛化能力:

  • LIBERO-Pro(考察物体位置、任务要求变化):总体成功率45.0%,远超其他基线模型最高11.0%。
  • LIBERO-OOD(考察组合泛化,即未见过的任务组合):总体成功率63.9%。

值得关注:物理AI的新范式

VPP2的成功标志着世界动作模型的竞争焦点从单纯的“预测未来”转向“将预测转化为通用行动”。星动纪元提出了**“GPT负责想,VPP2负责做”**的技术范式:

  • 高层认知:利用VLM(视觉语言模型)作为高层规划器,负责语义理解、记忆管理和任务拆解。
  • 底层执行:VPP2负责预测物理变化并生成具体动作。

实验数据显示,在RoboDojo长程任务中,引入VLM子任务规划后,平均成功率从27.6%提升至57.6%。这一闭环体系(认知-规划-预测-执行-反馈)有望形成更完整的物理AI能力体系。目前,星动纪元已与中国邮政、顺丰等企业开展合作,在全国5个省市、10余个物流中心进行常态化运营,验证了模型在物流场景下的落地潜力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。