生数科技提出通用世界模型五级发展路线,从世界生成走向世界组织者

2026/08/24 18:09阅读量 2

生数科技在世界机器人大会分论坛发布最新研究成果,提出通用世界模型五级发展路线:从世界生成、实时交互、物理行动,到自主智能体与世界组织者。其世界动作模型Motubrain推理速度较前代提升约10倍,在RoboTwin 2.0基准测试中以96.1分位居榜首。

事件概述

8月19日,在世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”上,生数科技创始人兼首席科学家朱军发表主旨演讲,系统阐述通用世界模型的五级发展路线,并介绍团队最新研究成果。

核心观点:通用世界模型是闭环反馈系统

朱军认为,通用世界模型不是单一的生成器、模拟器或策略模型,而是将理解、预测与行动三项能力耦合在一起的闭环反馈系统。行动会改变环境并产生新信息,进入下一轮理解、预测和决策。

三大要素:数据、架构与算力

  • 数据:需构建从网络视频到真实机器人交互数据的多层数据金字塔,合成数据可贯穿各层,且“不完美数据”(失败尝试、纠正动作)同样包含有效学习信号。
  • 架构:采用MoT(Mixture-of-Transformers)架构,为不同模态配置专属参数,并通过共享注意力实现跨模态信息交互。基于该架构的世界动作模型Motubrain,将环境理解、世界状态预测与动作轨迹生成统一在同一模型中。
  • 算力:实时交互和机器人控制对推理延迟要求极高,需依赖训练基础设施、推理加速、模型蒸馏和高效注意力机制等支撑。

五级发展路线及已有实践

  • L1 世界生成:让模型学习生成连贯的世界演化过程,代表模型为2024年发布的视频生成大模型Vidu。
  • L2 与世界交互:模型接收实时输入并持续改变后续内容。2026年7月发布的Vidu S1支持通过语音实时介入生成过程。
  • L3 在世界中行动:模型进入物理世界,直接生成机器人可执行动作并依据反馈修正。2025年12月发布的Motus已全面开源;2026年4月发布的Motubrain实现了统一建模,推理速度较Motus提升约10倍,适配新机器人本体仅需50至100条人类示范数据,在RoboTwin 2.0基准测试中得分96.1分,位列榜首,并已在银河通用、星尘智能、千寻智能等近十种机器人本体上完成验证。
  • L4 自主世界智能体:模型需围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。
  • L5 世界组织者:模型统筹机器人、数字智能体、人类、工具等资源,完成复杂任务分配与多智能体协作。

尚需突破的关键挑战

从L1至L3已有较具体的实践,但迈向L4和L5还需在目标形成、主动探索、持续学习、长期记忆等方面补齐能力,并解决视频模型的生成质量、可控性、时空一致性,以及世界动作模型在复杂开放环境中的稳定性、泛化能力与执行效率等问题。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。