李飞飞 World Labs 发布 Atlas:3D 世界模型实现“子弹时间”与空间智能突破
2026/09/02 18:30阅读量 2
李飞飞创立的 World Labs 发布了名为 Atlas 的 3D 世界模型,该模型仅需 3-5 个稀疏视角即可重建高保真三维场景,打破了传统多机位阵列拍摄的限制。Atlas 原生支持相机位姿(Camera Pose)精确控制,允许用户在后期自由调整虚拟摄影机的运动轨迹和景别,实现了从二维像素生成到三维空间理解的跃迁。该技术旨在通过 Real-to-Sim-to-Real 路径,为具身智能和人形机器人提供低成本、规模化的训练数据与环境仿真能力。
事件概述
World Labs 发布了其最新的 3D 世界模型 Atlas。与传统依赖高密度相机阵列(如 VOGUE 盛典中使用的 60 台 iPhone 或《黑客帝国》中的 120 台相机)来捕捉连续视角不同,Atlas 仅需 3 到 5 台普通手机或运动相机拍摄的稀疏视频素材,即可生成具有几何一致性的动态三维场景。这一技术突破被类比为将科幻游戏《赛博朋克 2077》中的“超梦”编辑模式带入现实,即用户可在事后自由移动镜头,从任意角度重新审视已记录的时空片段。
核心技术与机制
- 架构基础:Atlas 采用“多模态自回归扩散 Transformer”架构,将文字、图像、深度信息及相机位姿(Camera Pose)整合进统一的“空间上下文”。
- 稀疏视角重建:模型利用输入的真实稀疏视角维持几何一致性,并基于训练中学到的世界先验推断和生成未被覆盖的区域(如物体背面或遮挡区)。官方指出:“它看见的越多,需要‘想象’的就越少。”
- 原生几何控制:与主流视频生成模型在二维像素层面根据文本语义推演运镜不同,Atlas 将相机位姿作为原生几何输入参数。用户可像在 3D 软件中一样,直接设定虚拟摄影机的精确运动轨迹、转速和距离,且这些坐标与现实空间严格对应。
- 输出格式:除了最终视频像素,Atlas 还能同步导出稠密深度图(Depth)、三维点云(Point Cloud)以及 3D Gaussian Splatting 场景,支持实时渲染和自由穿梭。
应用场景与战略意义
- 影像创作革新:将摄影决策从现场推迟至后期。摄影师不再受限于物理机位,可在拍摄后通过调整参数获得特写、俯瞰等全新视角,极大提升了创作自由度。
- 具身智能与机器人训练:World Labs 强调 Real-to-Sim-to-Real(真实 → 仿真 → 真实)的核心概念。Atlas 能从少量实拍视频中重建逼真的数字孪生世界,使算法能在其中低成本地规划导航、推演机械臂抓取等操作,并通过改变物体摆放、光照和背景生成近乎无限的训练数据,解决具身智能缺乏丰富评测环境的瓶颈。
- 公司背景:World Labs 由李飞飞创立,今年 2 月完成 10 亿美元融资,并于 7 月收购机器人与仿真公司 SceniX。其研究主线从早期的 ImageNet(教电脑看懂二维照片)转向探索空间智能(教电脑理解三维空间的物理规律与时空连续性)。
