昆仑行世界模型GeWu登顶WorldArena单项冠军,因果架构重塑具身智能基准
昆仑行机器人研发的昆仑世界模型GeWu在权威评测WorldArena 2.0 Track 1中表现优异,以69.58分斩获图像质量单项冠军,并以65.91的综合得分获得全球亚军。该模型在77支参赛队伍中唯一有4项指标进入前四,尤其在物理一致性和可控性上实现大幅领先。其核心创新在于摒弃传统模态拆分,采用基于“目的-干预-响应”因果逻辑的三塔Transformer架构,显著提升了模型对物理世界的模拟与规划能力。
事件概述
在具身智能领域权威评测基准 WorldArena 2.0 的 Track 1 赛道中,昆仑行机器人(Kunlunx AI)研发的 昆仑世界模型 GeWu 取得突破性成绩。该模型从全球77支顶尖参赛团队中脱颖而出,以 69.58分 的成绩获得 图像质量(Image Quality)单项冠军,并以 65.91分 的综合得分位列 全球亚军。值得注意的是,GeWu 是本次评测中唯一在6大评估维度中有4项进入前4名的模型,显示出极强的综合竞争力。
WorldArena 由国际顶尖高校及科研机构联合共建,被视为具身世界模型的“国际竞技场”。Track 1 赛道重点考核模型的基础核心能力,特别是“看得准、猜得对、画面真实合理”以及物理因果关系的合理性。
核心信息:基于物理因果的架构创新
昆仑世界模型的设计哲学建立在“物理因果”这一第一性原理之上。研发团队认为,优秀的具身智能大脑不应仅停留在动作模仿或视觉渲染,而必须具备理解真实物理世界因果关系的能力,即能够预测“执行某动作后世界将如何变化”。
1. 三塔因果架构设计
有别于主流模型按“文本、视觉、动作”进行模态拆分的做法,GeWu 依据因果图中的角色语义,构建了三个参数独立的 Transformer 塔(Tower),并通过联合因果注意力机制(United Causal Attention)实施严格的单向可见性约束:
- Tower 1 (Intent/目的):负责编码语言指令和场景理解,确定“要做什么”。
- Tower 2 (Intervention/干预):负责建模动作序列,确定“怎么做”。
- Tower 3 (Consequence/响应):负责生成未来视频帧,呈现“做了之后会发生什么”。
信息流控制逻辑:
- Tower 2 可参考 Tower 1,但不可见 Tower 3(决策时不偷看结果)。
- Tower 3 可同时参考 Tower 1 和 Tower 2(生成画面时需结合意图与动作)。
这种架构确保了行动决策独立于视觉后果,而视频渲染则严格遵循动作轨迹,从而避免生成违背物理规律的画面。
2. 关键性能验证
- 消融实验证明必要性:一旦切断任意一条因果通路,模型会从“因果仿真”退化为“默写模式”,导致物体在无对应动作下自行运动等物理违规现象。例如在“挂杯子”任务中,切断动作与视频的因果联系会导致杯子位置不合理;而在终版模型中,由于 Tower 3 同时接收文本和动作输入,生成的视频严格遵循物理轨迹。
- 交互质量高分:得益于因果架构,GeWu 在核心维度 交互质量(Interaction Quality) 上取得了 82.40 的高分,确保物体严格遵循末端夹爪操作,接触后的行为符合物理规律。
3. 长时序生成与多任务支持
- 仿生记忆采样策略:针对长时序视频生成中的上下文缺失问题,模型模仿人类记忆衰减规律,近端帧高密度保留以维持运动连续性,远端帧稀疏采样以保留全局进度。配合绝对时序位置编码和帧率自适应放缩,有效解决了物体凭空消失、形变及背景噪点累积问题。
- 统一推理框架:借鉴 UniDiffuser 思想,通过调整噪声参数,同一套架构可在世界模拟、策略推理、联合预测等模式间灵活切换。采用异步调度策略,确保动作塔去噪进度领先于视频塔,提供干净可靠的动作信息。
值得关注
昆仑世界模型 GeWu 的成功表明,将归纳偏置对齐至物理世界的因果结构,不仅能提升评估指标,还能同步改善训练效率和泛化能力。目前,该模型已应用于行为规划和仿真强化研究,旨在推动具身智能从视觉渲染器向真正的物理智能基座进化。
