Figure AI Helix 2.5 发布:宣称发现机器人 Scaling Law,但同行质疑泛化能力与可靠性
Figure AI 发布 Helix 2.5 人形机器人,在 30 套陌生住宅中完成整理、铺床和折叠毛巾任务,整体成功率 56%,并宣称发现了“人类到机器人迁移”的 Scaling Law。然而,同行批评者指出近半数失败率暴露了模仿学习在真实家庭环境中的泛化瓶颈,认为其尚未达到实用所需的可靠性标准。该争议反映了具身智能领域从实验室演示向真实世界部署过渡时的技术路线分歧。
事件概述
Figure AI 发布了新一代人形机器人 Helix 2.5,并在旧金山湾区的 30 套未进行任何数据采样的陌生住宅中进行了实地测试。公司宣称实现了零样本(zero-shot)泛化能力,即机器人无需针对特定房间或物品重新训练即可完成任务。同时,Figure AI 提出其在机器人领域发现了类似大语言模型的 Scaling Law(缩放定律),认为随着预训练数据量的增加,机器人性能将持续稳定提升。
核心信息与技术细节
1. 测试表现与零样本泛化
- 测试场景:Helix 2.5 被直接运入 30 套住宅,执行三项长时程全身任务:整理客厅玩具、折叠毛巾、铺床。团队未对房屋布局、家具位置或具体物品进行微调。
- 成功率数据:
- 总测试次数:420 次。
- 完整任务成功次数:237 次。
- 整体成功率:56%。
- 分项成功率:铺床约 67%(94/140),折叠毛巾约 62%(87/140),整理玩具约 40%(56/140)。
- 对比实验:未经过 Figure AI 人类行为数据集 Index 预训练的对照模型,在相同测试中成功率仅为约 9%。这表明预训练赋予了模型跨环境迁移的能力。
- 纠错机制:机器人在陌生环境中表现出动态调整能力,如后退重新站姿、移动至床的另一侧继续操作,而非机械重复预设轨迹。
2. Scaling Law 的宣称
- 数据规模实验:Figure AI 使用四个不同规模的 Index 数据集(1倍、2倍、4倍、8倍)训练模型,固定模型大小和下游任务数据。结果显示,随着预训练数据量翻倍,预测机器人下一步动作的误差持续下降。
- 外推预测:利用前三组实验数据预测最大规模训练结果,最终误差仅占变化区间的 0.54%,符合线性缩放预期。
- 未来投入:公司已与 Nscale 签署协议,承诺初始 35 亿美元算力,计划部署最高 10 万块英伟达 Vera Rubin GPU,以支持数据规模的持续扩大。
行业争议与批评
尽管 Figure AI 将此次发布视为里程碑,但同行专家对其技术路线的有效性提出了尖锐质疑,主要集中在可靠性和泛化定义上。
1. 可靠性不足(Tony Zhao, Sunday Robotics)
- 观点:“有用的工作 = 泛化 + 可靠性”。56% 的成功率意味着接近一半的任务失败,这在涉及易碎品、儿童和宠物的家庭环境中是不可接受的。
- 对比:Sunday Robotics 的 ACT-2 系统在衣物折叠测试中达到 99.1% 的成功率(尽管单次测试对象不同,但强调了高可靠性的必要性)。
2. 泛化能力的本质质疑(Nikolai Ensslen, Synapticon 前 CEO)
- 观点:真正的泛化应指系统在任何新环境下都能稳定工作。Helix 2.5 高达 44% 的失败率证明其模仿学习系统并未真正掌握泛化能力,只是在更大范围的数据分布中进行了模仿。
- 技术路线分歧:批评者认为,传统视觉-语言-动作模型缺乏对三维空间语义和失败原因的深层理解,一旦偏离训练经验,无法像基于大语言模型的 Agent 那样通过反思和修正来应对未知情况。
值得关注
Figure AI 的估值已达 390 亿美元,Helix 2.5 是其押注“预训练+模仿学习”路线的关键验证。如果随着数据量和算力的增加,成功率能如 Scaling Law 预测般稳步提升至 80%-90% 以上,这将是具身智能的重要突破;若成功率停滞在半数附近,则可能证实同行关于模仿学习在复杂家庭场景中泛化瓶颈的担忧,引发对当前主流技术路线的重新评估。
