生数科技发布通用世界模型战略:从视频生成到机器人行动的统一基座

2026/07/22 08:48阅读量 2

生数科技创始人朱军在世界人工智能大会上提出通用世界模型概念,认为AI应从内容生成走向理解世界、预测并行动。公司基于统一MoT架构,从视频生成模型Vidu延伸到实时交互模型Vidu S1和世界动作模型Motubrain,打通数字与物理世界。视频数据作为大规模预训练底座,机器人数据补充精确动作反馈,两条路线形成互补。

事件概述

7月20日,在世界人工智能大会(WAIC)期间,生数科技创始人、清华大学人工智能研究院副院长朱军提出,通用世界模型的核心是通过统一基座与架构实现对世界的理解、预测与行动。模型不应只服务于机器人或自动驾驶单一场景,而应同时支撑数字内容生成、实时交互与物理行动。

核心能力:理解、想象、行动

  • 理解:感知并理解当前环境;想象:预测不同输入或动作带来的变化;行动:将预测转化为可执行决策。
  • 世界模型不同于仅预测下一帧的视频模型,要求形成从状态理解到行动指导的闭环。

数据与架构

  • 数据金字塔:从海量互联网视频(通用视频、第一视角、合成数据)到机器人轨迹数据,规模与精度逐级提升。视频数据提供通用世界规律,机器人数据补充关节角度、力反馈等精确动作知识。
  • 架构:采用Mixture-of-Transformer(MoT)统一框架,将环境理解、状态预测与动作轨迹生成整合。模型可在像素空间生成视频,也可在动作空间输出机器人可执行动作。

产品演进路径

  1. Vidu:世界生成模型,支持文/图/参考生视频,保障主体一致性与物理合理性,用于广告、短剧等生产场景。
  2. Vidu S1:实时交互模型,接受用户语音指令持续改变角色行为,支持无限时长连续生成(540P、25-42FPS),可创建真人/动漫交互角色。
  3. Motubrain:世界动作模型,将环境理解与预测转化为机器人动作轨迹,面向插花、浇水等长程任务。通过统一建模实现从“生成世界”到“在世界中交互”再到“行动于世界”的递进。

数字与物理世界的互补关系

  • 数字世界:提供大规模视频数据与快速产品反馈,试错成本低;物理世界:提供精确动作数据与严格因果检验,结果不可掩盖。
  • 视频预训练为机器人提供通用知识,机器人行动反馈可提升视频模型的物理合理性,数字内容商业回报支撑基座训练。

值得关注

  • 生数科技并非从视频生成横跨到机器人,而是将视频建模能力向实时交互与物理行动自然延伸。
  • 最终考验在于:数字内容能否提高可用率、降低生产成本;机器人能否在不同本体与动态环境中长期稳定运行。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。