李飞飞World Labs发布全球首个多模态世界模型Atlas:打通Real-to-Sim关键路径

2026/09/02 09:07阅读量 4

李飞飞创立的World Labs发布了名为Atlas的全球首个多模态世界模型,该模型基于多模态自回归扩散Transformer架构,具备相机控制生成、3D空间重建及时空模拟能力。Atlas能够仅凭少量真实图像生成逼真的RGB和深度数据,为机器人提供高保真训练环境,被视为具身智能领域Real-to-Sim(从现实到仿真)的关键突破。目前该模型正逐步向合作伙伴开放早期访问,并计划作为未来Marble等产品的底层基础。

事件概述

李飞飞创立的AI公司World Labs正式发布了新一代世界模型Atlas。官方将其定义为“全球首个多模态世界模型”,旨在通过像素级相机控制和3D重建技术,实现空间与时间的统一建模。这一成果被视作从视觉特效到机器人应用的重要里程碑,特别是为具身智能提供了从真实世界数据到仿真环境的高效转换路径。

核心技术与能力

Atlas采用了一种全新的多模态自回归扩散Transformer架构,旨在一个统一的模型中处理多种任务、输入和输出数据。其核心技术特点包括:

  • 架构融合:结合了LLM推理加速技术(如KV Cache、缓存感知路由)与现代图像/视频生成模型的潜空间扩散算法(如Rectified Flow、扩散蒸馏)。所有输入数据(文本、图像、视频、3D深度图等)均被锚定在三维空间中,形成“空间上下文”。
  • 相机控制生成:仅需一张图片,即可生成具有像素级相机控制的图片和视频,最高支持1分钟、1440p分辨率的输出。测试显示,在复杂相机轨迹下,其性能优于当前最先进(SOTA)的视频模型。
  • 空间重建:基于一张至数十张输入图像,重建真实世界场景。不仅能生成新视角图像帧,还能输出显式3D表示,效果超越专门针对3D重建训练的现有模型。
  • 时空模拟:同时建模空间和时间,可转换已有视频的视角,制作戏剧性视觉效果,并支持机器人训练工作流。
  • 图像生成:支持文本生成图片及360°全景图,能遵循复杂提示词并准确渲染文字。

具身智能应用价值

Atlas的核心应用场景聚焦于具身智能(Embodied AI)中的Real-to-Sim流程:

  1. 解决数据瓶颈:机器人训练面临缺乏廉价、可控且可规模化经验的问题。Atlas只需几张照片,即可生成逼真的RGB和深度数据,构建多样化的模拟空间供机器人训练和测试。
  2. 技术演进脉络
    • 2026年6月:李飞飞定义世界模型分类,强调“模拟器”是几何、物理和动力学的基础。
    • 2026年7月:World Labs收购机器人仿真公司SceniX,随后公开Real-to-Sim-to-Real系统。
    • 当前:Atlas的发布打通了从真实照片/视频到3D空间,再到机器人传感器视图的完整路径。

进展与展望

  • 扩展性:团队指出Atlas的设计已为Scaling做好准备,证据表明其能力随规模扩大而持续提升。
  • 产品规划:Atlas将成为未来版Marble及其他World Labs产品的底层模型。
  • 访问权限:目前Atlas正向部分合作伙伴开放早期访问,用户也可通过官网申请访问权限。

参考来源:World Labs官方博客

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。