北大、NTU等推出世界动作模型ω-0,人形机器人实现“边走边做”居家操作
2026/08/13 11:44阅读量 2
南洋理工大学、北京大学、香港科技大学(广州)与智源研究院联合发布世界动作模型ω-0,可基于语言指令直接生成全身动作,支持人形机器人“边移动边操作”。在11项居家实操测评中,全场景模式成功率81.8%,超越π-0.5、EgoVLA等基线模型;团队同步开源真实家庭人形机器人数据集ω-HOME。
事件概述
南洋理工大学、北京大学、香港科技大学(广州)与智源研究院联合提出隐空间预测世界动作模型ω-0。该模型在输入语言指令后,可同步识别环境、感知自身状态,直接输出底层控制系统可读取的精简动作特征,支撑人形机器人完成“边移动边操作”的全身协同任务。
核心信息
- ω-0摒弃了以往“先走到目标位置、站稳后再操作”的分步式策略,也不采用耗时较长的“视频到动作”逆向转换,而是构建统一查询表征,让未来视觉特征提供任务进度和场景演变的宏观指引,动作分支直接生成全身动作潜在指令。
- 训练采用三阶段递进体系:第一步进行全身动作VLM专属预训练;第二步借鉴V-JEPA思路,融合视觉、语言与机器人本体数据,通过视频查询预判未来环境特征;第三步引入真实居家移动操作数据进行精细化微调。
- 在11项高难度居家实操任务中,ω-0的Ego第一视角模式成功率达79.1%,Omni全场景模式成功率达81.8%,全面超越π-0.5、EgoVLA、GR00T-N1.7、ψ-0等主流行业基线模型。测试任务涵盖跨区域物品收纳、高低位杂物清理、床上衣物拾取等复合场景。
- 团队同步开源真实世界家庭人形机器人数据集ω-HOME,包含40.3小时真实环境数据、4827条任务轨迹、24项任务。每条轨迹均同步含语言指令、第一/第三视角、本体状态、全身运动轨迹等数据,可降低下游任务训练对示范数据的依赖。
值得关注
ω-0的关键突破在于将人形机器人的移动与操作作为一个整体进行建模,而不是把腿和手分开控制,使机器人在移动中操作、在操作中调整姿态成为可能,为其从实验室演示走向生活化服务提供了新的技术路径。
