五大高校联合发布TriWorldBench首周榜单,机器人三视角世界模型评测体系正式亮相
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起TriWorldBench Challenge,推出首个面向机器人三视角世界模型的评测榜单。首周已有14支团队参赛,前三名分别为CASIA-DRL的WoVR_Plus、TONGJI Spatial Intelligence Team的BetaBWM和Fysics AI的Fysiverse-Video。该评测聚焦头部、左腕、右腕三视角的时空一致性与物理理解,推动具身世界模型从“视觉生成”走向“世界理解”。
事件概述
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起 TriWorldBench Challenge(三视角世界模型评测挑战),并于近日公布首周榜单。该评测定位为首个面向机器人三视角世界模型的评测基准,目标是建立更全面的具身世界模型评价体系,推动世界模型从“视觉生成”迈向“世界理解”。
首周榜单前三名分别由 CASIA-DRL 的 WoVR_Plus、TONGJI Spatial Intelligence Team 的 BetaBWM 和 Fysics AI 的 Fysiverse-Video 获得。官方统计显示,榜单发布后网页总访问量破万,测评工具下载量超200,日访问量逾千,一周内已有14支正式参赛队伍。
核心信息
- 评测对象:机器人操作场景中的 head view(头部视角)、left-wrist view(左腕视角)、right-wrist view(右腕视角)三路视频生成与理解能力。
- 评测维度:围绕三视角一致性、任务对齐、物理与3D一致性、运动质量、时序一致性、视觉质量六个维度,汇总19项评测信号,最终以 TWB-Score 作为榜单总分。
- 基准规模:包含500个三视角同步episode,覆盖50个机器人操作任务。
- 评测重点:三路视角须共同描述同一次机器人操作,包括机械臂动作阶段、抓取接触进度、目标物体状态互相兼容;同时关注任务指令是否执行、操作是否合理、物理空间与3D关系是否一致。
评测机制与特点
TriWorldBench 将三视角一致性放在体系核心。每个生成视角先与对应真值相机对照,再通过 head-wrist 语义判断和联合三视角问答,检查机械臂状态、动作阶段、接触关系与目标物体是否兼容。头部视角更适合判断任务指令、全局轨迹与最终结果,腕部视角则用于观察接触、抓取稳定性与局部几何,避免腕部遮挡干扰全局判断,也防止头部画面掩盖夹爪附近的失败。
基准还从参考机器人轨迹构建 STATE 标注(动作状态标注),识别动作阶段、活动机械臂及各视角应处于运动还是静止状态,以区分“全程不动”和真正理解任务。视觉质量评分会受任务约束修正,防止生成错误但画面精致的视频获得不合理优势;VLM 语义评测则先与人类专家打分对齐,再冻结规则用于正式测试。
榜单除总分排名外,还保留六个维度、单项指标、逐视角和配对结果,帮助研究团队定位问题出在任务、运动、画质还是三视角状态不一致,使其兼具排名与诊断工具功能。
开放与持续更新
TriWorldBench Challenge 面向全球具身世界模型、具身智能、视频生成模型、多视角生成与理解方向研究团队开放,官网和 GitHub 仓库已上线,评测结果将随参赛模型增加持续更新。
