李飞飞World Labs发布Atlas:以几何重建突破具身智能数据瓶颈

2026/09/14 17:40阅读量 2

李飞飞创办的World Labs发布新一代世界模型Atlas,号称全球首个能同时处理文字、图片、视频和3D的多模态模型。Atlas通过引入“空间上下文”机制,仅需少量普通照片即可实现高保真3D场景重建与自由视角控制,大幅降低了3D内容生产门槛。该模型旨在为具身智能提供低成本、高效率的仿真训练环境(Real-to-Sim),解决机器人真实世界训练数据匮乏的核心痛点,尽管其在物理规律理解上仍处初级阶段。

事件概述

AI领军人物李飞飞旗下的World Labs发布了新一代世界模型Atlas。官方宣称这是“全球首个”能同时处理文字、图片、视频和3D的多模态世界模型。该模型的核心突破在于将相机位姿参数作为原生输入,构建了“空间上下文”,使得模型能够基于少量图像输入,重建出完整的三维场景并支持自由视角的镜头调度。

核心技术与能力

  • 低门槛3D重建:传统3D重建依赖密集拍摄和专业设备,而Atlas依托大模型的先验知识,仅需2-25张由普通手机拍摄的图像,即可实现高保真的3D场景重建。这意味着海量旧照片和影像数据可以被激活转化为可用的3D资产。
  • 精确的相机控制:不同于以往视频生成模型中相机运动靠提示词“玄学抽卡”的方式,Atlas将相机姿态和深度信息连同图像一起输入模型。用户可以直接指定坐标和轨迹,实现对画面视角的精准控制,如复刻电影中的“子弹时间”效果。
  • 从渲染到模拟的跨越:虽然目前主要体现为几何层面的空间理解,但Atlas的目标是构建可交互、可推演的“世界模拟器”。它致力于将AI生成能力拓展至机器人领域,实现Real-to-Sim(从现实到仿真)的转化。

行业意义与挑战

  • 解决具身智能数据瓶颈:机器人训练面临真实数据采集成本高、效率低的难题。Atlas通过快速将真实环境搬进虚拟世界,并允许在虚拟环境中进行海量试错和策略训练,为具身智能提供了一条低成本、可扩展的训练路径。World Labs已收购专攻机器人仿真的SceniX,进一步布局这一战略。
  • 几何与物理的区别:文章指出,Atlas目前的惊艳表现主要集中在几何层面(物体位置、形状、视角变化),而在物理规律(碰撞、摩擦、形变等)的理解上仍有差距。当前的评测体系(如WorldArena, WorldBench)显示,现有模型在物理交互准确性上普遍未过关,Atlas尚未经过严格的第三方物理评测。
  • 资本与市场风向:世界模型赛道的竞争焦点正从“画面逼真度”转向“状态经得起算的物理一致性”。Atlas的出现有望推动“仿真优先、真机验证”的新范式普及,降低初创公司在机器人训练上的硬件和数据成本。

关键结论

Atlas证明了将几何空间关系工程化解决的可行性,并为具身智能提供了重要的基础设施雏形。尽管距离真正理解物理世界尚远,但它被视为物理AI发展的一块重要踏脚石,标志着AI生成内容从静态视觉向动态交互环境的演进。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。