李飞飞发布全球首个多模态世界模型Atlas:几张照片实现高精度3D重建与空间智能模拟

2026/09/02 15:31阅读量 2

World Labs发布全球首个面向空间智能的多模态世界模型Atlas,原生支持文本、图像、视频及3D深度信息处理。该模型仅需少量照片即可生成高一致性视频并重建复杂3D场景,在稀疏视角重建任务中表现优于Pi3X等主流模型。其核心目标是为具身智能提供低成本仿真训练环境,解决机器人数据采集难题。

事件概述

World Labs正式发布了全球首个多模态世界模型 Atlas。该模型定位为“omni world model”,从零开始预训练,能够原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一架构下完成世界生成、空间重建和时空模拟。

核心功能与技术突破

1. Camera Controlled Generation(相机控制生成)

  • 输入方式:将“相机位姿参数”作为底层原生输入,而非仅依赖自然语言提示词。用户只需提供1到6张普通照片及运镜轨迹,即可生成长达1分钟、分辨率1440p的视频。
  • 效果:画面空间几何一致性强,运镜丝滑。对于未拍摄区域,模型基于先验知识进行合理补全(如脑补背影或延伸背景),但视角跨度极大时仍可能出现局部几何漂移或纹理闪烁。

2. Spatial Reconstruction(空间重建)

  • 低资源需求:传统3D扫描需数百张照片和专业设备,Atlas仅需2到25张地面平拍照片即可还原高精度3D场景。
  • 案例演示:在斯坦福大学Main Quad案例中,模型成功重建了草坪、拱廊及教堂外墙,并支持上帝视角漫游。
  • 性能数据:在DTU、ETH3D、ScanNet等公开数据集的稀疏视角重建误差测试中,Atlas得分25.3(AbsRel ×10⁻³,分数越低越好),显著优于Pi3X(28.7)、Depth Anything 3(39.3)和MapAnything(47.7)。
  • 输出兼容:直接输出点云和3D Gaussian Splatting格式,可无缝接入World Labs的Marble平台进行高帧率即时渲染。

3. Reframing Video(重新构图视频)

  • 利用少量普通手机或运动相机拍摄的素材,通过虚拟空间视角切换,实现类似“子弹时间”的电影级效果,无需好莱坞级别的环形相机阵列。

技术架构

Atlas采用 Multimodal Autoregressive Diffusion Transformer 架构,结合了以下优势:

  • Multimodal:原生融合文本、2D图像、相机位姿与3D深度。
  • Autoregressive:像语言模型预测下一个词一样,在时空序列中逐级预测新的空间状态。
  • Diffusion:基于Rectified Flow逐步去噪,确保连续高维信号的画质与几何精度。
  • Transformer:利用成熟矩阵乘法结构适配大规模算力集群,支持KV Cache及分布式推理优化。

应用场景:具身智能与机器人训练

Atlas的核心目标是解决具身智能领域的痛点——虚拟训练场构建成本高、周期长。

  • Real to Sim 路线:通过录制真实场景视频,快速生成高精度3D物理空间孪生体,供机器人进行试错训练。
  • 物理模拟:能模拟机械臂对刚性物体、铰链柜门及软体海绵的受力反馈。
  • 成本效益:相比传统方式收集机器人训练数据可能高达100万亿美元的成本,Atlas大幅降低了仿真环境搭建的人力与时间投入。

性能对比与能力拓展

  • 盲测胜率:在镜头运动控制的真人盲测中,Atlas对阵MiniMax H3胜率为75%,Gemini Omni Flash为81%,FLUX 3为93%,Seedance 2.5为94%。
  • 其他能力:具备较强的图像生成能力,支持复杂Prompt、文字渲染及多种艺术风格;可直接生成360°全景图,保证空间连续性。

战略意义

World Labs强调模型的Scaling效应,随着参数量和算力提升,模型展现出类似大语言模型的涌现能力。Atlas旨在弥补当前LLM缺乏三维空间理解与世界经验的缺陷,赋予机器对几何、物理、时间及行动后果的认知,从而推动AI从数字世界走向现实世界的具身应用。目前Atlas已向部分合作伙伴开放Early Access,并将成为Marble及其他产品的底层模型。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。