RSS 2026 实录:AGI 撞上“物理之墙”,具身智能转向以“想象力”为核心的进化路径
RSS 2026“机器人世界模型”专题现场,多场报告共同聚焦一个核心矛盾:AGI 的 Scaling Law 在云端数据上有效,却在物理世界遭遇时间、空间和数据获取的硬约束。Pi、OpenDrive Lab 与英伟达分别从目标图像、组合式模型和全模态底座给出解法,强调让机器人在行动前“想象”和推演。具身智能正从“背诵动作”转向“举一反三”,世界模型被重塑为机器人的逻辑中枢与虚拟沙盒。
事件概述
2026 年 7 月,RSS 2026 于悉尼举行。在“Robot World Models”主题 Workshop 上,与会者形成共识:大模型在云端可依赖“参数量 + 互联网数据”涌现能力,但机器人受制于真实世界的时间线性与空间约束,无法无限复制数据。Scaling Law 在拧螺丝、找物体等物理任务上明显失效,行业因此转向以“世界模型”为机器人提供行动前的想象、预测和评估能力。
核心报告
Pi 团队:世界模型提供“目标图像”
Pi 团队核心成员 Laura Smith 指出,世界模型不是视频生成器,而是提供“目标图像”。实验中,一台未学习过操作空气炸锅的机器人,在无遥操作数据的情况下,仅通过观看人类炸红薯的视频就完成了任务。其原理是机器人通过世界模型“脑补”出完成状态,并将人类视频中的常识与自身已有基础技能进行逻辑插值。团队还实现了叠衣服技能在不同机器人之间的跨身体迁移。这显示视觉推理正在替代对大量动作标签的依赖。
OpenDrive Lab:组合式世界模型
OpenDrive Lab 研究者陈立提出,当前全像素生成路径难以同时兼顾生成质量和评估准确性,因此“预测”和“评估”必须解耦。其 RISE 框架将世界模型拆分为动力学组件与价值组件:前者负责“想象未来”,后者判断安全性和任务目标一致性。这种设计可在虚拟空间中模拟大量失败路径,在不增加真实风险的前提下提升数据效率,也为资源受限的团队提供了更务实的路线。
英伟达:Cosmos 3 开源全模态底座
英伟达专家 Max Li 介绍了 Cosmos 3,称其为全球首个在统一 Transformer(MoE)架构下打通文本、视觉、音频和动作的全模态世界基础模型。该模型通过“大脑与肢体”协议统一汽车、单双臂、人形机器人等不同形态的动作矢量语义,并以“推理器 + 生成器”协同实现逆动力学反推与状态转移。模型分为服务器级 Super(64B)、Nano(16B)和端侧 Cosmos Edge(4B),后者可在 Jetson 等设备上实时推理。英伟达已将全套模型、代码和论文开源,意图以底层生态掌握物理 AI 时代的标准。
值得关注的技术亮点
- Interactive World Simulator 支持超过 10 分钟、15 FPS 的稳定视频预测,机器人可在 0 真实数据训练下完成绳索理顺和杯子抓取。
- 有研究利用微型扬声器和麦克风,以声学传感替代视觉进行顺应性控制,为人形机器人提供低成本的触觉感知方案。
结论
RSS 2026 传递的核心信号是:机器人正从“死记硬背”动作轨迹,转向具有“预判与想象”能力的智能体。世界模型不再只是视频 Demo,而是机器人的逻辑中枢和智能涌现的沙盒。2026 年被视为具身智能从“大力出奇迹”走向“举一反三”的转折点。
