具身智能新共识:ICL路线在三大机器人模型中展现“经验”泛化能力

2026/09/04 19:23阅读量 2

8月19日至27日,Generalist、Skild AI和蚂蚁灵波相继发布基于上下文学习(ICL)的机器人模型,标志着该路线成为具身智能的主流共识。这些模型通过少样本演示即可执行未见任务,展现出超越传统VLA架构的泛化能力和智能涌现现象。研究表明,ICL能将视频等丰富空间数据编码进行预训练,其效率远高于语言提示方式,有望在大规模训练下实现性能反超。

事件概述

2024年8月19日至27日期间,Generalist、Skild AI以及蚂蚁灵波(Ant Group's Lingbo)密集发布了三款基于上下文学习(In-Context Learning, ICL)路线的机器人模型。尽管技术细节各异,但这三家机构均实现了让机器人在仅接受少量或少样本演示的情况下,执行未经过训练的新任务的能力。这一现象表明,ICL正逐渐取代传统的视觉-语言-动作(VLA)主导模式,成为具身智能通往物理世界交互的核心共识。

核心信息与技术突破

1. 模型发布与性能表现

  • Generalist (Gen1.5): 经过8个月预训练,Gen1.5展示了持续的智能涌现规律。在未训练的新任务中,其平均成功率达到59%。例如,当被给予一段将方块扫入碗的演示并新增一个簸箕时,模型能零组合出全新的接触序列,利用簸箕完成任务,且无需语言指导。
  • Skild AI: 展示了包括种植盆栽、翻烤煎饼、制作咖啡和组装工具在内的四种场景演示。在10万小时训练基准上,其在未见任务中的成功率达到66%,远超VLA路线的9%。该模型具备抵抗干扰、纠正错误及基于演示组合新技能的能力。
  • 蚂蚁灵波 (Zero-WAM): 推出基于因果视频-动作建模的Zero-WAM框架。通过引入专门为零样本任务设计的上下文世界动作预训练,将人类演示视频转化为语义对齐的指令,使双臂机器人在长程未见任务(如堆叠方块)中的成功率从0提升至9.00±2.16%。

2. ICL相对于VLA的优势

  • 泛用性与抗退化: 传统依赖语言提示的VLA模型在处理长程复杂任务和长上下文时会出现明显性能退化。一旦应用场景或动作变换,往往需要重新收集数据或微调策略。相比之下,ICL能够编码视频、因果等更丰富的空间数据进行预训练,具备更强的泛用性。
  • 数据效率: Skild AI预估,上下文中的一个演示大约相当于380个VLA后训练样本。随着预训练规模扩大,ICL路线在多项目标上的优势可能指数级拉大,预计在30k小时以上的训练规模下表现出明显的优越性。

3. “经验”与智能涌现

  • 历史脉络: ICL的概念可追溯至2017年的单样本学习和2018年DAML的人类视频训练。2022年Chan等人的研究指出,Transformer的上下文学习能力取决于数据的成簇性、长尾分布及含义可变性。随后的研究进一步证实,包含强化学习历史轨迹的数据形态是促使机器习得智能的关键。
  • 涌现现象: 三大模型的共同发现是,零样本/少样本演示带来了即兴的任务执行能力。这种能力表现为面对意外情况(如物体变换、场景迁移)时的随机应变基础智力,这与真实世界的运转状态高度接近。

值得关注

  • Scaling Law预期: 业界普遍认为ICL是实现通用物理智能的潜在路线。虽然目前小规模训练下ICL存在过拟合导致精确度不足的问题,但随着训练规模的扩展,其性能有望超越依赖海量数据后训练的VLA路线。
  • 未来挑战: ICL路线仍面临训练稳定性不足、对数据集质量和算力规模要求高等挑战。清华大学团队近期发布的《Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation》也验证了将视觉状态、动作编码归结为因果关系映射结构的有效性,进一步佐证了该方向的研究价值。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。