生数科技发布通用世界模型五级发展路线:从世界生成到世界组织者

2026/08/25 09:46阅读量 2

8月19日,生数科技在世界机器人大会分论坛上提出通用世界模型五级发展路线,将能力划分为世界生成、与世界交互、在世界中行动、自主世界智能体和世界组织者五个层级。公司已通过Vidu、Vidu S1、Motus及Motubrain覆盖前三级实践,其中Motubrain在RoboTwin 2.0基准测试中以96.1分位居榜首。

事件概述

8月19日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”在北人亦创国际会展中心举行。生数科技创始人兼首席科学家朱军发表主旨演讲,发布最新研究成果,并提出通用世界模型五级发展路线。

通用世界模型的定义

朱军认为,通用世界模型不是单一的生成器、模拟器或策略模型,而要具备三项彼此关联的能力:

  • 理解世界:看懂环境,判断当前状态;
  • 预测未来:预测接下来可能发生什么,以及不同动作带来的结果;
  • 采取行动:影响数字或物理环境,并利用真实反馈修正理解和预测。

这三项能力构成闭环反馈系统:行动改变环境、产生新信息,并进入下一轮理解、预测和决策。

构建通用世界模型的三大要素

  • 数据:需要从海量网络视频逐步走向真实机器人交互数据的分层数据金字塔,合成数据可贯穿各层;“不完美数据”(失败尝试、纠正动作等)同样能提供有效学习信号。
  • 架构:MoT(Mixture-of-Transformers)为不同模态配置专属参数,以共享注意力实现跨模态信息交互;基于该架构的Motubrain将理解、预测与行动统一建模。
  • 算力:实时交互和机器人控制对推理延迟要求更高,训练基础设施、推理加速、模型蒸馏和高效注意力机制是关键支撑。

五级路线与已有实践

  • L1 世界生成:让模型学习生成连贯的世界演化过程。2024年发布的视频生成模型Vidu完成初步实践。
  • L2 与世界交互:模型接收实时输入并持续改变后续内容。2026年7月发布的Vidu S1支持用户通过语音实时介入生成过程。
  • L3 在世界中行动:模型从数字世界进入物理世界,统一环境理解、未来预测和动作生成。2025年12月发布的Motus已全面开源;2026年4月发布的Motubrain将环境理解、状态预测和动作轨迹生成统一到同一模型,推理速度较Motus提升约10倍,适配新机器人本体仅需50至100条人类示范数据,在RoboTwin 2.0基准测试中得分96.1、位居榜首,已在银河通用、星尘智能、千寻智能等近十种机器人本体上完成验证。
  • L4 自主世界智能体:面向长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。
  • L5 世界组织者:统筹机器人、数字智能体、人类、工具及其他资源,完成复杂任务分配与多智能体协作。

迈向L4、L5的六项关键挑战

  • 建立覆盖理解、预测、行动和迁移能力的联合评测体系;
  • 学习接触、摩擦、作用力和干预后果等真实物理规律;
  • 形成持久且可修订的记忆;
  • 通过真实交互实现在线学习和自我进化;
  • 完成满足现实延迟与资源约束的高效闭环部署;
  • 进一步强化安全性与可控性。

生数科技表示,将持续强化世界生成、与世界交互、在世界中行动三个层级,并补齐目标形成、主动探索、持续学习和长期记忆等能力,为更高阶的自主世界智能体奠定基础。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。