机器人泛化能力的核心:从数据规模转向迁移效率
机器人行业的竞争分水岭已从单纯追求数据规模转向评估每单位新增真机数据所能换取的泛化能力。行业主要存在两条路径:一是以Physical Intelligence等为代表的扩大数据覆盖范围,二是以Field AI、Mujin等为代表的提高迁移效率,后者通过构建世界模型或几何物理规则实现低成本适配。真正的泛化能力需通过五类具体场景检验,并观察新任务适配成本曲线是否持续下降。
事件概述
机器人训练的核心矛盾在于如何处理经验与泛化的关系。当前行业普遍高估了数据规模的重要性,而忽视了数据处理能力——即从具体轨迹中提炼跨场景复用规律的能力。机器人公司的真正分水岭,不在于积累了多少案例库存,而在于系统能否将经验抽象为可复用的结构,从而用更少的真机数据完成新任务的低成本迁移。
核心信息
1. 两条研发路径的分歧
目前通用机器人模型的前沿梯队主要分为两种策略:
- 扩大覆盖范围(体力活): 代表公司包括 Physical Intelligence、Figure AI 和 Skild AI。该路径认为“多见多记”是增强泛化的可靠办法,因此资源主要投向数据采集装置、遥操作、标注管线及场景覆盖。这种做法稀缺性低,已成为行业共识。
- 提高迁移效率(脑力活): 代表公司包括 Field AI、Mujin 以及 Sharpa。该路径优先投资结构先验、世界模型或几何物理规则,旨在减少昂贵且缓慢的真机采集。其核心逻辑是:系统面对新任务时,能否利用既有原则进行判断和行动,而非从零开始。
2. 可复用结构的构建方式
根据环境边界的清晰度,提高迁移效率的路径分为两类技术实现:
-
环境边界不清晰时(全模态/信念世界模型):
- Sharpa: 由禾赛科技创始人创立,专注于灵巧操作。其策略是在第一个复杂场景(如冰淇淋店全流程)中投入大量时间建立全模态世界模型,以此压低下一个场景的适配成本。其核心在于通过真实交互信息预训练,并利用边界情况回流持续更新模型。
- Field AI: 美国创业公司,致力于非结构化环境(户外、危险场地)。核心技术为 Belief World Model(信念世界模型),机器人依据新观测持续更新对世界状态的估计,从而实现跨形态、跨任务、跨场景的泛化。
-
环境边界清晰时(几何与物理规则):
- Mujin: 日本工业机器人软件公司,针对物流拆垛、码垛等场景。它不依赖海量行为克隆数据,而是将三维感知、解析逆运动学、碰撞约束直接写入控制系统。面对新箱型或位姿,系统通过重新求解问题来适应,无需重新采集数据。
- 其他玩家: 梅卡曼德、星猿哲和仙工智能也采用了类似思路,将感知、规划或移动控制封装为可复用的产品或控制器,减少针对新物体或新底盘的重复适配工作。
3. 泛化能力的检验标准
仅看总数据量或单次示教次数无法真实反映泛化能力,需从以下两个维度进行评估:
-
五类具体能力核验:
2. 场景切换: 面对光照、遮挡或布局变化,是否需重新建图或训练。
3. 任务切换: 是否能理解新目标并组合出未训练过的行动序列。
4. 形态切换: 策略或表征能否在不同机器人形态(如机械臂、四足、人形)间复用。
5. 失效恢复: 遇到抓空、打滑等异常时,能否基于新观测重新规划并继续任务。 -
新任务成本曲线:
关键指标是随着完成任务数量的增加,适配下一个任务所需的新增真机数据和时间是否呈现持续下降的趋势。若曲线未下降,说明系统积累的仅是案例库存;若曲线下降,则证明数据已被提炼为可复用能力。
4. 小样本干预的有效性基础
OpenAI 的 PALMS 实验表明,大模型可以通过少量精选样本(如80条问答)将行为原则迁移到训练集未覆盖的主题。这一现象在机器人领域同样适用:Google DeepMind 的 Gemini Robotics On-Device 仅需约 50-100 次示教即可适配新任务。这并非因为数据量少,而是因为模型携带了此前预训练形成的可迁移能力(如 RT-2 从互联网数据中学到的知识),新增数据仅用于填补具体场景的最后缺口。
值得关注
- 数据披露的遮蔽效应: 许多公司只披露新增真机数据或少量示教次数,却隐藏了庞大的预训练数据和合成数据规模。评价时需同时考量整体训练成本,避免被“少数据高效能”的表象误导。
- 工业落地的理性选择: 对于固定工位的工业机器人,不追求开放世界泛化可能是理性选择;但对于宣称做“通用机器人”的企业,若不追求泛化而依赖每个新任务重新采集数据,将无法形成核心竞争力。
- 成本曲线的决定性作用: 未来几年拉开差距的公司,不是今天数据最多的,而是那些能让新任务适配成本曲线下降最快的公司。
