英伟达Cosmos 3深度拆解:统一文本、视频与动作,要做具身智能时代的“安卓系统”

2026/08/19 14:15阅读量 3

在RSS 2026上,英伟达详细介绍了其世界基础模型Cosmos 3,这是全球首个在同一Transformer架构下打通文本、视觉、音频和动作的全模态模型。该模型提供Edge、Nano、Super三种规格,通过统一多模态与边缘端部署,旨在为具身智能提供标准化底座,推动其从“组装机”走向“整机一体化”。

事件概述

在RSS 2026“机器人世界模型”工作坊上,英伟达物理AI专家Max Li介绍了新发布的世界基础模型Cosmos 3。官方称其为全球首个在同一Transformer架构下打通文本、视觉、音频和动作全模态的模型,目标是为物理AI与具身智能提供统一底座。

核心设计

  • 三大能力:理解世界(类似VLM推理环境状态)、模拟未来(在仿真中低成本试错)、执行动作(将意图在真实世界具现化)。
  • 架构:分为Reasoner(负责理解,类似VLM)和Generator(负责跨模态生成视频、音频和动作),采用MoE架构,推理时使用因果自注意力,生成时使用双向注意力。
  • 统一动作:通过启发式规则将汽车、相机运动、单臂/双臂机器人、人形机器人等不同具身形态的动作矢量映射到共享语义空间。
  • 训练模式:包括动力学模式(给定动作预测视频)、逆动力学模式(给定视频反推动作)和策略模式(视频与动作联合训练)。
  • 多模态对齐:以24 FPS为基准对齐不同帧率的视频;语言、视频、音频和动作分别采用不同的位置编码策略。

模型矩阵与数据

  • Cosmos提供三种规格:Cosmos Edge(4B MoE,两个专家塔各2B,为边端实时推理设计,砍掉了音频)、Cosmos Nano(16B MoE,各8B)、Cosmos Super(64B MoE,各32B)。
  • 预训练阶段:推理器使用约2200万个可训练样本;生成器使用约220万个样本,折合约1000万小时视频。
  • 训练分三阶段:预训练(图像/视频生成)、中期训练(引入动作及跨域仿真数据)、后训练(针对Nano/Super优化文生图、文生视频、图生视频及策略模型)。
  • 扩展定律显示,在图像和视频生成上,模型越大优势越明显。

关键结论与开源

  • 预训练阶段不引入PID等控制信息,模型作为纯粹的状态转移机器;后训练阶段加入控制信号,使模型在特定机器人任务上实用化。
  • 在物理精确度评估中,使用VBench等基准;引入动作能显著提升机器人和具身智能相关领域的视频预测精度。
  • Cosmos 3完全开源,项目有超过100人参与,代码、模型和论文均已发布。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。