佐治亚理工学院徐丹飞:视频预测≠机器人规划,组合式世界模型破局
2026/07/27 10:29阅读量 2
佐治亚理工学院助理教授徐丹飞在RSS 2026指出,高保真视频生成不等于机器人物理规划,提出基于因子图与时间注意力机制的组合式世界模型,以解决视频预测与真实动作之间的断层,提升机器人在长流程任务中的执行成功率。
事件概述
在RSS 2026会议上,佐治亚理工学院助理教授徐丹飞(Danfei Xu)发表演讲《组合式世界模型》,直言当前具身智能领域存在“视频预测≠机器人规划”的核心误区。他指出,即便模型能生成完美的未来画面,机械臂在实际执行复杂任务时仍频频失效,原因在于“生成”是在已有数据分布中提取高概率结果,而“规划”需在测试阶段针对新长流程与物理约束实时构造有效解。
核心观点与方案
1. 组合式世界模型与因子图
徐丹飞团队将复杂系统解耦为模块化基础技能,并在测试时像搭积木一样动态组合。采用因子图(Factor Graphs) 替代传统线性串联,在时空维度定义约束:空间上约束机械臂末端与物体的相对姿态;时间上确保运动过程物理同步;多臂协同时只需训练单臂技能,测试时通过因子图组合即可。该方法使机器人能完成双手协同抬起重物、锤钉等单臂难以完成的任务。
2. 视频-动作断层(Video-Action Gap)
即使世界模型预测出完美未来视频,机器人动作仍可能无法跟随。原因是视频大模型吸收海量视觉数据泛化能力强,而底层动作数据匮乏,导致动作控制泛化滞后。团队提出时间注意力比例(Temporal Ratio) 指标,发现:机器人接近目标时高度依赖未来轨迹预测,进入抓取阶段则瞬间回归当前帧的触觉与视觉微调。基于此,引入测试期策略引导,在接近目标时强化前瞻注意力,接触物体时拉回当下,显著提升分布外任务执行成功率。
3. 对失败数据与模型分立的看法
- 失败数据价值:当前偏好成功数据,因缺乏能消化失败视频的规划器。若能构建理解物理约束的规划算法,预测失败同样重要。未来有意识地捕获失败轨迹可扩展世界模型安全边界。
- 世界模型与策略模型应保持分立:原因一,模型仍处于欠拟合状态,强行引入控制目标会增加收敛难度;原因二,两者对数据利用方式本质不同——策略模型偏好高质量成功数据(适合SFT/RL精调),世界模型需吞下海量失败与异常数据以构建完整物理认知。解耦优化更为稳妥高效。
