世界模型竞逐AGI:技术路线之争与未解难题

2026/08/17 19:38阅读量 2

世界模型正成为AI研究前沿,被视为通往AGI的可能路径。学界和产业界在“像素级重构”与“抽象表征”两大路线上分道扬镳,代表系统包括World Labs的Marble、DeepMind的Genie 3与Dreamer 4、Meta的V-JEPA 2等。尽管资本涌入,但世界模型能否真正复现人类智能仍存根本疑问。

事件概述

世界模型已成为AI研究的前沿方向,被部分研究者视为通往通用人工智能(AGI)的可行路径。与依赖海量文本训练的大语言模型(LLM)不同,世界模型试图通过观察世界、学习世界运行规律,让AI能预判行为后果,从而具备真正的理解与规划能力。

核心信息

  • 世界模型源于认知科学:1943年心理学家肯尼斯·克雷克提出人类心智承载着外部现实的小型模型,可推演备选方案。这一理念经“预测加工理论”等发展,成为AI研究者构建智能系统的重要参考。

  • LLM的局限是动因:大语言模型只掌握文字描述,不理解物理现实。2024年一项研究显示,用纽约出租车导航数据训练的语言模型虽能规划合理路线,但在绕行等变更场景下表现糟糕。叠衣服等需模拟物理世界的任务也暴露其短板。

  • 产业界快速布局:2024年4月,李飞飞创办World Labs,专注“空间智能”,融资2.3亿美元。2025年12月,杨立昆离开Meta,创立AMI实验室,并于2026年融资超10亿美元,主攻世界模型系统。谷歌DeepMind也在推进相关项目。

  • 现有原型距离“真世界模型”尚远:World Labs的Marble本质是3D视频生成器,DeepMind的Genie 3则更像交互式视频游戏模拟器,并非能自主推理规划的完整智能体。

  • DeepMind的Dreamer 4:该系统“观看”大量人类玩《我的世界》的录像,构建内在世界模型,通过虚拟试错学习行动决策。演示中,它在无示范情况下自行摸索出开采钻石的方法。项目主导者称,相比Genie 3,Dreamer 4已是一套内置世界模型的智能体。

  • 两大技术路线之争

    • 生成式路线:追求像素级重构,逼真模拟行动后果。
    • JEPA路线(杨立昆倡导):主张高度压缩的抽象表征,只预测对推理、行动有意义的部分,过滤无关细节。Meta于2025年6月发布的V-JEPA 2是实证,通过遮蔽视频区域并预测抽象表征来学习物理规律。

值得关注

  • 抽象表征是否够用:布朗大学专家兰德尔·巴莱斯特里埃罗指出,尚不清楚提炼出的抽象信息能否支撑开放环境中的智能体进行推理和规划。

  • 时间抽象与元认知缺失:哈夫纳认为世界模型需具备时间抽象能力,而非逐帧模拟。梅兰妮·米切尔则强调AI缺乏元认知——不知道自己知道什么、不确定程度有多大,世界模型未必能弥补这一短板。

  • 专家警示:乔什·特南鲍姆认为人类智能并非单一模型,而是随场景切换多种模型,仅靠扩大世界模型规模很难复刻人类认知。米切尔担心“世界模型”成为万能标签,掩盖AI与AGI之间仍存的巨大鸿沟。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。