李飞飞实验室黄文龙 RSS 2026 演讲:具身智能应转向反事实推理与“脑内搜索”

2026/08/19 14:11阅读量 3

在 RSS 2026 的 Data-Centric Robotics Workshop 上,斯坦福大学李飞飞实验室的黄文龙提出,具身智能不应继续依赖海量演示数据,而应转向反事实推理与“脑内搜索”。他介绍了 Point-World,通过 3D 点云流统一机器人动作与场景表示,并展示了仅用 15 小时 3D 交互数据配合 2D 预训练即可超越此前 500 小时训练的效果。

事件概述

在 RSS 2026(悉尼)的 Data-Centric Robotics Workshop 上,斯坦福大学李飞飞实验室的黄文龙(Wenlong Huang)发表演讲,提出具身智能需要从“背诵演示数据”转向“反事实推理”与“脑内搜索”。他认为,物理世界的数据获取存在时间和空间上的不可逆性,长尾场景无法靠穷举覆盖,单纯堆叠数据并不能让机器人具备真正的自主能力。

核心观点

  • 反事实推理是关键能力:机器人需要能评估“如果我采取一组完全不同的动作,结果会怎样”。黄文龙以 AlphaGo 第 37 手为例,指出论文数据显示,如果移除测试时的搜索过程,需要增加 10 万倍数据量才能维持同等性能。
  • 为什么选择 3D 空间:语言和代码空间无法描述类似“翻袜子”的底层物理交互;动作空间又因机器人形态不同而难以统一。黄文龙认为,最佳反事实推理空间是基于机器人几何结构的 3D 空间。
  • Point-World:零样本世界模型:该工作将机器人的动作空间统一定义为“3D 点云流(3D Point Flows)”。给定 RGB-D 输入与机器人 URDF 描述文件,从每个连杆采样点并计算正运动学,使场景观测和机器人动作统一到同一表示中。基于 Transformer 的模型可作为零样本真实世界模拟器,能处理刚体、流体、布料等可变形物体,无需物体分割;还能隐式识别冰箱等物体的运动关节,并在目标被遮挡时依据物理常识推断接触关系。
  • 数据效率大幅提升:团队利用视觉几何模型对大规模交互数据(Joy 数据集)进行重标注,生成了约 3500 小时的 3D 点云。后续未发表实验显示,先用 2D 视频数据预训练,再仅用 15 小时 3D 交互数据微调,就能获得比此前 500 小时训练更好的环境动力学预测能力,且在未见过的环境和机械臂上仍保持较高物理保真度。

值得关注

黄文龙此前以 VoxPoser 和 ReKep 等工作为人熟知,其思路是通过大模型将抽象指令转化为 3D 空间的关键点约束与价值场,让机器人无需行为演示即可完成复杂操作。此次演讲将这一思路延伸到世界模型层面。他总结的路径是:先获得关于行为与动力学的通用先验(世界模型),再在物理世界中通过反事实推断和搜索不断获取新行为,最终走向机器人的“递归自我改进(Recursive Self-improvement)”。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。