Atlas以3D重建突破世界模型瓶颈:几何可测,物理待补
2026/09/15 19:20阅读量 3
World Labs发布多模态世界模型Atlas,能从少量照片直接重建机器可读的3D几何场景,大幅降低机器人训练场构建成本。与Sora生成视频不同,Atlas输出点云等几何数据,重塑了视觉输入的空间上下文规则。目前Atlas仅解决几何问题,缺乏物理属性,World Labs通过收购SceniX推进Real-to-Sim-to-Real工作流,试图打通从几何重建到物理仿真的完整链路。
事件概述
2026年9月,World Labs发布全球首个多模态世界模型Atlas。该模型的核心能力是从最少2张照片重建可被机器直接读取的3D几何场景,标志着世界模型从“生成画面”向“构建可测量空间”的转变。尽管在几何重建和时空模拟上取得突破,但当前版本仍缺乏物理属性,需依赖外部引擎或后续收购的技术进行补全。
核心信息
1. 技术路线差异:几何数据 vs 像素视频
- 本质区别:Sora等模型生成的是给人看的视频文件,关注像素连贯性和视觉逼真感;Atlas输出的是点云、3D高斯泼溅等机器可直接解析的几何数据,关注空间坐标准确性和程序可读性。
- 空间上下文:Atlas将每张照片锚定在三维坐标上,识别多张照片的方位关系并拼出完整3D场景,使视觉输入从“拍到了什么”升级为“从哪拍的、和周围什么关系”。
2. 效率提升与门槛降低
- 低成本构建:仅需手机拍摄2-25张普通照片,即可自动生成可导入仿真器的3D场景。相比传统专业测绘需数百张照片及数天手工建模,效率从数天降至几分钟。
- 渐进式重建:官方演示显示,随着输入图片增加(如从局部特写到全景再到侧面视角),模型“脑补”部分减少,场景还原度提高。通常2-3张图即可实现可用重建。
3. 时空模拟与虚拟数据采集
- 相机可控生成:用户输入1-6张参考图并设计相机运动轨迹,模型沿轨迹生成最高1440p、最长1分钟的视频。在第三方盲测中,Atlas对MiniMax H3、阿里HappyHorse 1.1、字节Seedance 2.5的胜率分别为75%、86%、94%。
- 无限变体生成:通过同步录像冻结时间帧,可从任意角度回看。一个真实场景可生成上千种变体(改变路线、障碍物、光照),无需重新搭建场地。数据采集主体从真实机器人转向虚拟机器人,实现“跑一趟用无数次”。
4. 当前短板:物理属性缺失
- 架构限制:Atlas仅负责“画”场景,不输出碰撞检测、刚体动力学、摩擦力等物理参数。其损失函数基于图像帧预测误差,优化画面保真度而非物理准确性。
- 角色定位:在仿真链路中,Atlas充当“视觉渲染器”,仅提供RGB图像和深度图,物理演算需对接MuJoCo、PhysX等外部引擎。
5. 未来演进:收购SceniX推进物理仿真
- 战略收购:2026年7月,World Labs收购机器人仿真公司SceniX,旨在结合Atlas的空间建模能力与SceniX的物理仿真技术栈。
- Real-to-Sim-to-Real工作流:展示了一套闭环流程——录制真实操作视频转化为带物理属性的仿真环境,训练策略后部署回真实机器人。演示中,RB-Y1机械臂完成线缆操作,YAM机械臂完成可变形物体操控,均实现零真实数据迁移。
值得关注
- 行业意义:Atlas解决了“世界长什么样”的问题,为具身智能提供了低成本的数字训练场。但物理属性的缺失仍是阻碍Sim2Real(仿真到现实)迁移的关键瓶颈。
- 技术融合前景:若Atlas的几何重建与SceniX的物理注入成功融合,将打通从真实世界感知到物理仿真训练的完整管道,可能成为具身智能行业的重要转折点。
