Skild AI发布S1具身模型:无需后训练,通过视频演示实现长程任务上下文学习

2026/08/26 18:07阅读量 2

北美具身智能初创公司Skild AI发布了全新机器人基础模型S1,该模型支持最长10分钟的上下文学习(ICL),仅需观看一段人类示范视频即可掌握复杂操作流程,无需进行后训练微调。在未见过的任务中,S1的成功率达到66%,远超基于语言提示的VLA模型(9%)。这一进展标志着具身智能从依赖大量数据微调的“BERT时代”向类似GPT-3的“上下文学习时代”迈进,大幅降低了新技能的学习成本。

事件概述

北美具身智能初创公司 Skild AI 正式发布了其最新机器人基础模型 S1。该模型的核心突破在于实现了长达10分钟以上的上下文学习(In-Context Learning, ICL)能力。与传统的机器人学习路径不同,S1 不需要针对新任务进行后训练(Post-training)或微调,只需输入一段人类操作的视频演示,模型即可理解意图并执行整套复杂的长程任务。

核心技术与性能表现

1. 范式转变:从微调到上下文学习
传统机器人基础模型通常遵循“预训练+后训练微调”的路径,但这需要耗费大量真机数据进行采集和训练。Skild AI 指出,如果每个新任务都需要数百小时的数据重新训练,则失去了“基础模型”的意义。S1 借鉴了大语言模型从 BERT(需微调)到 GPT-3(通过 Prompt 示例实现零样本/少样本学习)的演进路线,旨在让机器人具备直接从上下文中学习新技能的能力,而无需修改模型权重。

2. 关键实验数据

  • 长程任务处理:S1 能够处理如煎饼、冲泡咖啡、给植物换盆及设备组装等包含数十个步骤的长程任务。在植物换盆任务中,从录制演示到机器人完成操作仅耗时11分钟,效率远超传统方法。
  • 泛化能力对比:在训练数据规模为10万小时的条件下,测试显示:
    • 已知任务:ICL 成功率 96%,语言提示 VLA 为 89%。
    • 未见任务(OOD):ICL 成功率高达 66%,而语言提示 VLA 仅为 9%,差距超过7倍。
  • One-shot 学习效率:在不进行任何后训练的情况下,仅看一次演示,S1 在新任务上的成功率为 66%。相比之下,传统 VLA 模型大约需要经过 380次 演示的后训练才能达到同等水平。

3. 技术原理
S1 使用动作视频作为“Prompt”,而非传统的文本语言。这种设计更好地对齐了下游物理任务。实验表明,随着训练数据规模的增加,ICL 的优势愈发明显,证明了“数据越多,模型越擅长从演示中学习”的 Scaling Law。

背景与行业意义

Skild AI 背景
Skild AI 由卡内基梅隆大学(CMU)教授 Deepak Pathak 和 Abhinav Gupta 于2023年创立。公司致力于实现 “Any robot, any task, one brain” 的理念,即开发一个通用的智能层,可适配机械臂、四足、人形等多种机器人形态。近期估值已超140亿美元,获得软银、英伟达等投资。

行业影响
S1 的发布被视为具身智能迈向“GPT时刻”的重要一步。它证明了机器人可以通过观察人类演示快速习得新技能,将新技能的开发成本从“教几百遍”降低为“看一遍”。这有望解决具身智能规模化落地中的数据瓶颈问题,推动通用机器人技术的快速发展。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。