Atlas发布:世界模型从“生成画面”迈向“可测量空间”的新阶段
World Labs发布多模态世界模型Atlas,通过3D重建技术将视觉输入转化为机器可读的几何数据,标志着世界模型从单纯的视频生成转向构建可交互的数字空间。Atlas仅需少量照片即可重建高精度3D场景,并支持相机位姿控制与时空模拟,大幅降低机器人仿真环境搭建门槛。尽管目前仍缺乏内置物理引擎,但通过收购SceniX,行业正加速探索从几何重建到物理仿真的完整闭环。
事件概述
2026年9月,World Labs发布了全球首个多模态世界模型Atlas。与Sora等专注于视频生成的模型不同,Atlas的核心能力在于通过3D重建技术,将二维图像转化为包含精确空间坐标和几何结构的数字资产(如点云、3D高斯泼溅)。这一转变使得世界模型不再仅输出供人观看的画面,而是提供可供计算机直接解析、机器人仿真器直接导入运行的“可测量空间”,推动了具身智能从感知向理解环境的跨越。
核心技术与能力
1. 空间上下文重塑视觉输入
传统视觉处理仅关注二维像素阵列,而Atlas引入了三维空间上下文机制。每一张输入照片都被锚定在具体的三维坐标上,模型能够识别拍摄角度及物体间的空间关系。例如,通过分析多角度的房间照片,Atlas能将其拼合为完整的三维地图,而非简单的图像拼接。这种机制让视觉模块和记忆模块能够直接在三维空间中运作,提升了模型对空间结构的理解精度。
2. 低门槛3D场景构建
Atlas显著降低了3D场景的构建成本。仅需2至25张普通照片,即可输出完整的3D场景。官方演示显示,随着输入图片数量的增加,模型需要“脑补”的部分减少,重建精度提升。例如,斯坦福大学主方庭仅凭几张手机拍摄的地面照片,便生成了高空俯瞰的连续飞行画面。这使得过去需要专业设备和数天时间的建模工作,缩短为几分钟即可完成,极大提升了Sim2Real(仿真到现实)的数据采集效率。
3. 相机控制与时空模拟
- 相机可控生成:用户可通过输入1-6张参考图及设计相机运动轨迹,生成最高1440p、时长1分钟的视频。第三方盲测显示,在基于相机位姿控制的测试中,Atlas对MiniMax H3、阿里HappyHorse 1.1及字节Seedance 2.5的胜率分别达到75%、86%和94%,证明了其在几何理解上的优势。
- 时空模拟:通过同步录制视频,Atlas可实现时间冻结和多视角回看。更重要的是,它能基于真实场景重建3D环境,并实时生成虚拟机器人的传感器数据(RGB图像和深度图)。一个真实场景可衍生上千种变体(改变路线、光照、障碍物等),实现了从“物理数据采集”到“虚拟数据生成”的转变,且因统一在同一个模型中,减少了环节间的误差传递。
局限性与未来演进
当前局限:缺乏物理属性
Atlas目前主要解决几何层面的问题,即“世界长什么样”。其生成的传感器数据仅包含RGB图像和深度图,不包含碰撞检测、刚体动力学参数或接触力计算结果。由于损失函数基于图像帧预测误差优化,而非物理演算准确性,Atlas在架构上被定位为“视觉渲染器”,无法独立处理物体受力变形、摩擦等物理交互问题。
战略调整:收购SceniX补齐短板
为解决物理仿真缺失的问题,World Labs于2026年7月收购了机器人仿真公司SceniX。SceniX的技术专长在于利用物理信息增强数字资产。双方计划结合Atlas的空间建模能力与SceniX的物理仿真栈,构建“Real-to-Sim-to-Real”闭环工作流:
- 录制真实世界操作视频;
- 转化为带物理属性的仿真环境;
- 在仿真中训练策略;
- 部署回真实机器人。
演示案例中,RB-Y1机械臂完成线缆操作、YAM机械臂完成可变形物体操控,均实现了零真实数据训练并直接迁移至多种真实平台。这标志着世界模型正在从单一的几何重建,向融合物理规则的全面环境模拟迈进。
