ECCV 2026聚焦世界模型:中国学者在边界定义、评测体系与具身落地三维度卡位
ECCV 2026会议中,世界模型(World Models)与具身智能成为核心议题,13个相关Workshop创下历史纪录。AI竞争焦点从“理解世界”转向“预测世界”,标志着生成式AI、3D高斯泼溅工程化与具身产业化压力的趋势合流。中国研究团队正通过重新定义模型边界(如WAM)、建立物理一致性评测基准(如4DWorldBench)以及推动真机融合应用(如eWAM),在世界模型赛道占据关键位置。
事件概述
2026年9月8日开幕的ECCV 2026(欧洲计算机视觉会议)显示,AI研究重心正从单纯的视觉理解向“预测未来”转移。本届会议共收到10,473篇投稿,接收2,883篇(接收率27.5%)。其中,直接以“World Models”或“Embodied AI”为主题的Workshop多达13个,为历届最高。Yann LeCun、Jürgen Schmidhuber等顶尖学者均围绕此主题发表Keynote,标志着世界模型已从边缘方向转变为行业主流共识。
核心信息:三大趋势合流
ECCV 2026上世界模型的爆发并非单一技术迭代,而是以下三股独立趋势的首次正式会师:
- 范式转移:受Yann LeCun提出的JEPA架构及Sora、Veo等工业界产品影响,学界普遍认同“智能的核心是预测物理世界”。
- 工程基础成熟:3D高斯泼溅(Gaussian Splatting)技术经过三年发展,已在SLAM、自动驾驶模拟、医学影像等领域实现工程化落地。其可微、紧凑的特性使其成为世界模型操作3D场景的自然Token候选。
- 产业交付压力:人形机器人和自动驾驶面临真实开放环境的泛化瓶颈,单纯模仿学习失效。Google DeepMind、NVIDIA等机构押注VLA(视觉-语言-动作)与世界模型的结合,旨在解决真实世界的行动闭环问题。
值得关注:中国学者的三个切入维度
中国研究者正从理论边界、评价体系到工程落地三个层面,系统性参与世界模型的核心构建:
1. 重新定义边界:从“生成”到“行动”
新加坡国立大学王新超团队提出**World Action Model (WAM)**概念,旨在厘清世界模型与视频生成模型的区别。该观点认为,真正的世界模型不应仅停留在预测“未来会发生什么”,而必须将预测结果用于指导“下一步应该做什么”。这种从被动预测到主动决策的转变,解决了具身智能中缺乏标准答案任务的规划难题。
2. 建立评测体系:关注物理一致性与可用性
针对世界模型“看起来真实但不可用”的问题,陈志波与李新团队提出了4DWorldBench评测基准。该基准超越了传统的图像质量评估,重点考察模型是否理解空间结构、保持时间连续性、符合物理规律,以及能否支持后续任务。此外,他们探索的VLA-JEPA架构尝试在潜空间中引入世界模型,使系统具备“如果我这样做,未来状态可能是什么”的预测能力,从而提升决策的可解释性和可靠性。
3. 推动真机落地:原生耦合与物理先验注入
中山大学梁晓丹和杨高团队致力于将世界模型嵌入真实机器人系统。梁晓丹团队提出的eWAM框架,主张将世界模型的潜空间预测作为VLA的内部监督信号,实现预测下一帧与输出下一动作的原生耦合。同时,通过ProPhy机制中的Mixture-of-Physics-Experts (MoPE),将物理先验逐层注入视频生成过程,使物理规律成为可优化目标。这些工作表明,世界模型正在从独立的预测模块,演变为约束机器人感知、决策和生成的共同基础设施。
