清华AIR与域变换发布Zeva:实现具身智能In-Context Causal Learning,冻结模型参数下能力自进化
2026/09/01 13:12阅读量 3
清华大学AIR与域变换联合推出具身智能模型Zeva,首次实现In-Context Causal Learning(ICCL)。该模型在完全冻结权重的情况下,通过双时标因果记忆机制,从交互经验中持续学习物理因果关系。实验显示,其在RoboCasa365基准上累计成功率从26%提升至73%,并支持单次人类演示快速适配新任务。
事件概述
清华大学人工智能产业研究院(清华AIR)与域变换公司联合发布了名为 Zeva 的具身智能模型。该研究提出了一种全新的 In-Context Causal Learning (ICCL) 范式,旨在解决具身智能体在部署过程中难以适应新环境、无法利用历史经验进行自我进化的问题。与传统依赖梯度更新或重新微调的方法不同,Zeva 能够在模型权重完全冻结的状态下,通过上下文推理实现能力的持续增长。
核心技术与机制
Zeva 的核心创新在于将“因果学习”嵌入到模型的推理上下文中,而非训练过程中。其技术架构主要包含以下三个关键模块:
-
Causal Transition Encoder(因果转换编码器):
- 显式建模动作与状态变化之间的因果关系。
- 提取视觉状态、动作编码及观察到的状态变化,递归编码为 Causal Interaction State。
- 通过因果效果预测、任务聚类和阶段进度等目标,确保生成的信号携带真实的物理因果信息。
-
Dual-timescale Causal Memory(双时标因果记忆):
- Brief Interaction Trace (BIT):负责当前尝试内的连贯执行,保证短期记忆的稳定性。
- Persistent Interaction Memory (PIM):跨多次尝试累积可复用的经验。无论是失败、修正还是成功的操作,都会被沉淀为后续可检索的上下文证据。
-
In-Context Policy Injection(上下文策略注入):
- 决策时,系统检索与当前任务阶段匹配的交互证据,构造 Causal Prompt。
- 将该提示注入到冻结的 Cosmos3 动作生成模型中,作为条件影响后续动作生成。
- 整个过程零梯度更新,不改变模型原有参数,避免了灾难性遗忘和高昂的计算成本。
实验结果与性能表现
Zeva 在仿真环境和真实物理场景中均展示了显著的自进化能力和泛化性能:
-
RoboCasa365-Atomic5 基准测试:
- Zeva 平均达到 76.8% 的成功率,优于现有方法。
- 自进化曲线:随着尝试次数增加,累计成功率从第1次尝试的 26% 显著提升至第4次尝试的 73%。
-
真实化学实验室场景 (ChemLab-Evo):
- 在三个原子任务中,模型表现出单调增长的学习曲线:
- Pick Up Test Tube:从 65% 提升至 100%。
- Place Beaker:从 25% 提升至 70%。
- Pour Water:从 30% 提升至 80%。
- 所有提升均在模型参数未更新的情况下实现。
- 在三个原子任务中,模型表现出单调增长的学习曲线:
-
One-Shot Human Demonstration(单次人类演示增强):
- 仅需一次人类演示即可初始化 PIM,使模型无需微调即可复现关键操作。
- 量化数据显示,人类演示在 Place Beaker 任务中带来最高 20个百分点 的提升,在 Pour Water 任务中带来 15个百分点 的提升。
行业意义
Zeva 代表了具身智能 Scaling Law 的新方向:从传统的“参数空间扩展”转向“上下文空间扩展”。
- 隐式系统辨识:模型通过在交互中积累因果证据,隐式估计物体质量、摩擦条件等物理属性,从而在不改变参数的情况下逼近真实物理动态。
- 跨域迁移能力:Causal Interaction Signal 在效应空间中具有紧凑表示,使得在不同物体、视角和任务指令下的等价物理效应能够被识别和复用,天然支持跨域迁移。
- 范式转变:Zeva 将部署过程从“能力消耗”转变为“能力积累”,每一次交互都成为可检索的因果证据,为具身智能在复杂物理世界中的自主进化提供了新的基础设施路径。
