通用机器人从单一形态转向分层架构:智能与身体的解耦与重组
2026/09/08 08:09阅读量 3
随着具身智能技术的发展,通用机器人的概念正从依赖特定物理形态(如人形)转向一种可适配多种本体的软件架构。蚂蚁灵波、Google DeepMind及英伟达等机构通过开源跨本体模型,实现了视觉理解、任务规划等高层能力在不同机器人构型间的共享。然而,由于“本体差距”的存在,底层物理交互仍需针对具体硬件进行适配,行业正逐步确立“上层智能共享、下层硬件模块化”的新产品逻辑。
事件概述
当前机器人行业呈现出一种看似矛盾的趋势:尽管业界频繁强调“通用性”,但实际部署的机器人形态却日益分化。从双足到轮式,从两指夹爪到五指灵巧手,不同的工作场景催生了截然不同的硬件配置。与此同时,AI技术正在试图打破这种硬件壁垒,通过跨本体模型将数据和能力从单一机器中剥离,使“通用机器人”逐渐演变为一种能够生长出不同身体的软件架构。
核心信息
1. 工作需求驱动身体分化
现实应用场景正在迫使机器人放弃单一的“人形”叙事,转而根据具体任务优化物理形态:
- 智元机器人:其远征A2-W在工厂搬运场景中表现良好,但受限于负载和传感器,后续规划了强调力控与大负载的G2 Max;同时推出四足形态的D2系列,显示其产品线正向多形态扩展。
- 银河通用:构建了差异化的产品矩阵,包括用于移动抓取的轮式双臂G1、具备50公斤级载重的工业重载S1,以及小型双足ET1,三者均由同一套“银河星脑”驱动。
- ROBROS:虽然面临制造物流领域对高负载的需求,但仍坚持双足设计以适配未改造的人类环境通道,体现了不同场景下的路径选择。
2. AI尝试跨越本体差异
为降低重复研发成本,多家科技巨头致力于开发能控制多种机器人构型的统一模型:
- 蚂蚁灵波 (LingBot-VLA 2.0):于2026年7月开源,使用约6万小时预训练数据,覆盖20种机器人构型。它通过55维规范化状态与动作表达,将不同自由度的机器人映射到共同的控制空间中。
- CrossFormer实验:利用90万条轨迹数据训练同一策略网络,成功控制机械臂、轮式、四旋翼及四足机器人,无需预先手工对齐观察空间和动作空间。
- Google DeepMind (Gemini Robotics 2):发布支持多本体的模型,同一检查点可控制Apollo 2(行走/抓取)、配备五指手的Apollo 2(精细操作)及Franka Duo(装箱)。对于新双臂机器人,仅需不到200个样本即可快速适配。
- 英伟达 (GR00T N1.7):开放模型权重和训练流程,采用相对末端执行器动作空间,允许基础模型通过后训练适配新的机器人、任务和环境。
3. “本体差距”限制完全通用化
尽管高层智能可以共享,但物理交互层面的“本体差距”(Embodiment Gap)依然显著:
- 精细操作难题:Gemini Robotics 2测试显示,Apollo 2拧下灯泡成功率高达92%,但重新拧回仅36%,扎紧垃圾袋约44%。这表明在涉及多指配合、持续接触和精细力控的任务中,身体差异会被迅速放大。
- 工程适配必要性:研究者指出,模型可以复用视觉理解和任务知识,但运动学适配、控制接口转换、传感器标定及安全机制仍需针对具体硬件进行工程调试。
值得关注
- 架构重构:通用性不再由单一硬件承担,而是分散到架构的不同层级。上层共享模型与数据,中间层负责本体映射与控制转换,下层保留适应具体任务的关节、负载和传感器。
- 产品逻辑转变:行业重心从“证明一副身体能做多少事”转向“换一副身体后有多少能力可复用”。智元等企业提出的硬件模块化和软件组件化,旨在实现约70%的共性基础上的差异化增量。
- 未来趋势:通用机器人不会消失,但将不再局限于同一种形态。更多机器人可能介于两者之间,在共同智能平台上,根据任务需求灵活组合负载、传感器和移动方式。
