生数科技朱军提出通用世界模型五级路线图:理解、预测与行动需闭环

2026/08/25 12:06阅读量 2

在世界机器人大会分论坛上,生数科技创始人朱军提出通用世界模型的定义和五级发展路线图,认为其核心是理解世界、预测未来和采取行动三种能力的耦合闭环。目前生数科技已覆盖至第三级,其世界动作模型Motubrain在RoboTwin 2.0基准测试中排名第一,并已在近十种机器人本体上完成验证。文章还梳理了向L4、L5进阶面临的六项关键挑战。

事件概述

8月19日,世界机器人大会的一场分论坛上,生数科技创始人兼首席科学家朱军分享了对通用世界模型的判断,并提出一个五级路线图。当前AI圈对通用世界模型的定义分歧明显:视频生成公司视其为模拟器,机器人公司视其为决策大脑,自动驾驶玩家也在押注。朱军从第一性原理出发给出了自己的框架。

核心信息

  • 定义:通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统:

    • 理解世界:看懂环境、判断状态
    • 预测未来:预判接下来会发生什么、不同动作带来什么结果
    • 采取行动:影响数字或物理环境,并用真实反馈修正理解与预测
  • 数据层面:朱军提出多层数据金字塔——底层是海量网络视频,向上依次为领域视频、第一视角人类视频和带动作记录的人类示范,塔尖是真实机器人交互数据。越往上数据越稀缺、成本越高,但跟任务动作和物理结果的联系越直接。

  • 架构层面:生数科技采用MoT(Mixture-of-Transformers)架构,不同模态各配专属参数,用共享注意力打通跨模态交互,实现环境理解、状态预测和动作生成在同一个模型中运行。基于该架构的世界动作模型Motubrain,将理解、预测与行动整合进一个模型,不再按模块拆分。

五级路线图

朱军将通用世界模型划分为五级,生数科技的实践覆盖前三层:

  • L1 世界生成:生成连贯的世界演化过程,视频是最典型载体,学习对象、运动、空间关系与时序变化。
  • L2 与世界交互:模型能接受实时输入(语言、语音或控制信号),后续内容随之改变,生成变为持续互动。
  • L3 在世界中行动:模型进入物理世界,统一环境理解、未来预测与动作生成,直接输出机器人可执行的动作,并用真实反馈修正。
  • L4 自主世界智能体:围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。
  • L5 世界组织者:调度机器人、数字智能体、人和工具,进行多智能体任务分配与协作。

当前进展与挑战

Motubrain是生数科技目前的核心成果。据生数科技数据,其推理速度比Motus快约10倍;更换机器人本体时,只需50到100条人类示范数据即可完成适配;在RoboTwin 2.0基准测试中获得96.1分,排名榜首;已在银河通用、星尘智能、千寻智能等近十种机器人本体上完成验证。

从L3向L4、L5演进,朱军指出六项关键挑战:建立覆盖理解、预测、行动和迁移能力的联合评测体系;学习接触、摩擦、作用力和干预后果等真实物理规律;形成持久且可修订的记忆;通过真实交互实现在线学习与自我进化;满足现实延迟与资源约束的高效闭环部署;保障安全性与可控性。

朱军表示,当理解、预测与行动真正形成闭环,世界模型将不再只是生成内容的模型或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。