国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路
2026/08/17 11:31阅读量 2
北京大学副教授卢宗青创立BeingBeyond智在无界,走隐空间世界动作模型路线,不生成画面而是直接在隐空间预测动作与世界响应。他认为视频生成路线训练成本高且无法实时控制机器人,而隐空间路线训练成本仅为前者的约1%。其团队已积累超50万小时人类第一视角视频,并于2026年7月发布全球首个隐式触觉世界动作模型Being-H0.8。
事件概述
北京大学计算机学院长聘副教授卢宗青,是国内最早系统性推进隐空间世界动作模型路线的团队负责人。2025年,他创立BeingBeyond智在无界,采用与主流视频生成路线不同的技术路径:隐空间世界动作模型(Latent World-Action Model)。该模型不生成画面,直接在embedding space中联合预测机器人下一步动作与世界如何响应,训练成本约为视频生成路线的1%,推理速度可支撑实时控制。
核心信息
- 数据积累:卢宗青早在2023年11月就提出“人类视频是具身智能唯一可以scale up的数据路径”,比行业广泛关注早近两年。目前团队已积累超过50万小时人类第一视角视频数据。
- 模型发布:2026年7月28日,BeingBeyond发布Being-H0.8,宣称是全球首个隐式触觉世界动作模型。该模型将触觉模态引入大规模预训练,并把视觉、触觉、动作及未来状态变化统一到同一隐空间,使机器人能理解“看到了什么、做了什么、接触到了什么”以及“世界因此发生了怎样的变化”。
- 路线对比:卢宗青指出,视频生成路线有两个问题:一是训练成本极高,大型视频生成模型预训练可能需要几万张卡、数月时间,成本达数亿元;二是真机跑不起来,机器人需要实时决策,画面未生成完时机已过。隐空间路线在相同数据和参数量下,训练成本约为像素空间生成模型的1%,且更容易学到物理规律和因果关系。
- 行业判断:卢宗青认为,对想走通用基础模型路线的创业公司,“数据飞轮”是伪命题,数据容易过度耦合自身本体构型。具身智能将形成产业链分工,本体公司是他们的客户。他判断,具身基础模型的确定性技术尚未出现,世界模型可能也不是答案;两到三年内行业会出现真正商业化落地,三到五年可能出现类似GPT-3.5阶段的具身基础模型。
