机器人迎来“GPT-3时刻”:GEN-1.5看几秒演示就能学会新动作

2026/08/21 15:17阅读量 6

Generalist AI 发布机器人基础模型 GEN-1.5,机器人仅需观看 3-12 秒动作演示即可零微调学会新任务,并可将不同演示拼接、跨模拟器迁移到真实世界。该能力并非显式训练,而是在大规模物理数据预训练中自然涌现。测试中一次提示下平均成功率 59%,被视作机器人领域的 GPT-3 时刻。

事件概述

Generalist AI 发布了新一代机器人基础模型 GEN-1.5。该模型通过大规模真实物理交互数据的预训练,使机器人能够仅凭数秒的动作演示学会新任务,整个过程无需梯度更新或微调。

核心能力

  • 少样本即学即用:人类演示 3-12 秒动作后,GEN-1.5 可立即执行该任务,无需任何参数更新或微调。
  • 演示可拼接:模型可将两段不同的动作演示组合成一个连续任务,中间未演示的衔接动作(如重新定位、切换姿势、失败恢复)也由模型自行补齐。
  • 模拟器到真实世界迁移:虚拟环境中的演示(脚本策略、强化学习 Agent 或人类遥控操作)均可作为教学输入,模型能将模拟器中学到的技能迁移到真实机器人,且此前未在任一环境中专门训练过该任务。

团队将这种能力称为**“物理版 Prompt Engineering”**——prompt 从一段文字变成一段真实世界中的动作演示,直接进入机器人的上下文。

能力来源

Generalist AI 并未专门训练 GEN-1.5 的 one-shot 学习能力。预训练过程中团队发现,新任务所需的数据量持续下降:从数百步微调逐步降到几十步、10步,最终在仅 1 分钟数据、1 个梯度步甚至 0 梯度步的情况下也能学会新技能。

团队认为,真实物理数据中天然包含大量重复动作、连续任务和失败后恢复的轨迹,模型在长期预训练中学会了“根据刚才发生的事决定下一步怎么做”,这已接近 in-context learning 的雏形。

测试表现

在 10 种任务上,GEN-1.5 在单次提示、0 次梯度更新下的平均成功率为 59%;若每个任务提供 5 分钟数据并追加 10 步梯度更新,成功率可提升至 83%。

目前测试任务仍以短程、原子化操作为主,通过 in-context 方式临时学到的技能,稳定性尚不及完整 fine-tune 后的模型。

值得关注

GEN-1.5 的意义在于将 in-context learning 从文本世界复现到物理世界。0 次训练即可达到 59% 成功率,被广泛类比为机器人领域的“GPT-3 时刻”。若这一路径能继续扩展,未来机器人出厂时最重要的能力或许就是“看着学”。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。