World Labs发布Atlas:从“渲染”到“模拟”,重新定义世界模型标准
2026/09/02 21:28阅读量 3
李飞飞创立的World Labs发布新模型Atlas,将其定义为二级“世界模拟器”,区别于仅生成画面的渲染器。Atlas通过原生输入相机位姿和深度图,实现三维重建与生成的融合,并能输出可测量的空间状态数据。该模型在机器人训练场景中展现出高价值,其验证标准侧重于决策排序的一致性而非成功率绝对匹配,旨在解决3D训练数据稀缺及物理交互模拟的瓶颈问题。
事件概述
2024年9月1日,李飞飞创立的World Labs正式发布新一代世界模型Atlas。该模型被官方明确归类为“世界模拟器”(Simulator),旨在突破当前AI领域普遍存在的仅能生成视觉画面的局限,提供具备可测量空间状态、支持机器人直接迁移训练的底层能力。
核心信息
1. 重新定义世界模型的三级标准
World Labs在今年6月发布的文章中,将市面上的世界模型系统划分为三个层级,以此界定Atlas的技术定位:
- 第一级:渲染器(Renderer)。仅负责生成连贯的视觉画面,不维护物体的物理属性或空间坐标。例如Google DeepMind的Genie 3及World Labs此前的RTFM模型均属于此类。
- 第二级:模拟器(Simulator)。即Atlas所属级别。不仅生成画面,还维护完整的空间状态(State),包括物体位置、尺寸、距离等可测量数据。这些数据可直接被机械臂控制代码或游戏引擎读取。
- 第三级:规划器(Planner)。在模拟器基础上,进一步具备动作决策能力,判断何时行动、选择何种策略。
2. 技术架构:多模态自回归扩散Transformer
Atlas的核心架构为multimodal autoregressive diffusion transformer,其创新点在于输入端的多模态融合:
- 原生输入:同时接收文字、图片、相机位姿(Camera Pose)和深度图(Depth Map)。
- 共享空间上下文:相机位姿提供了每张照片在三维空间中的精确坐标和朝向,使模型能够理解同一场景的不同视角,并建立基于位置的索引记忆机制,解决了传统模型在长序列生成中因上下文堆积导致的算力瓶颈和记忆混乱问题。
- 输出能力:除了常规图像,Atlas还能输出深度图、点云(Point Cloud)和3D高斯溅射(3D Gaussian Splatting)数据,确保生成结果具有几何精度和物理可测性。
3. 重建与生成的融合机制
Atlas打破了传统计算机视觉中“重建”与“生成”的界限:
- 渐进式补全:当输入照片较少时,模型利用训练数据中的常识对未拍摄区域进行“补全”;随着新照片输入,这些推测内容逐步被真实数据替换。
- 效率提升:仅需2-3张照片即可还原可用场景,单次最多支持100多张输入。这种机制使得模型能在保证几何一致性的前提下,高效构建完整3D环境。
4. 机器人训练与应用验证
World Labs于7月收购机器人公司SceniX后,利用Atlas进行了机器人训练测试,验证了其在Physical AI领域的潜力:
- 零真实数据训练:机器人在纯模拟器环境中完成装箱、绕线、搬试管等任务,随后直接迁移至真实机械臂上连续自主运行一小时,无需人工干预。
- 独特的评估标准:World Labs指出,模拟器无需追求与真实世界完全一致的“成功率”,因为物理参数(如摩擦力、重量分布)难以完美复刻。有效的标准是**“决策排序一致性”**——即模拟器中表现优于其他方案的策略,在真实世界中同样表现更优。这一思路借鉴了莱特兄弟的风洞实验原理。
值得关注
- 3D数据稀缺问题的缓解:与语言模型拥有海量文本语料不同,三维空间关系(如摩擦系数、物体交互状态)缺乏系统性记录。Atlas通过将几何和物理约束嵌入模型结构,降低了对大规模标注数据的依赖,为机器人低成本试错积累经验提供了可能。
- 行业分歧与技术路线:当前世界模型领域存在两派观点。一派认为通过预测高质量视频,三维结构会自然涌现;另一派(以Atlas为代表)主张直接将相机位姿、几何和物理约束作为原生输入,强制模型从第一天起就具备结构化认知。Atlas代表了后者的发展路径。
- 商业生态布局:Atlas作为World Labs的基础模型层,支撑着上层产品Marble(生成可探索3D世界)及World API。其融资方包括NVIDIA、Autodesk、AMD等,显示出其在工业数字孪生、建筑设计及机器人仿真等领域的跨行业应用前景。
