GPT-6 Astra展现通用模型控制机器人能力,OpenAI或成机器人领域“大脑”核心

2026/09/20 12:34阅读量 4

OpenAI的GPT-6 Astra模型通过视觉感知和推理能力,成功控制低成本机械臂完成绘画、抓取及任务模仿等复杂操作,在简单任务中成功率高达95%。尽管在精细力控和实时底层控制上仍存在短板,但这一进展表明通用大模型可直接作为机器人“大脑”,挑战了Physical Intelligence等专门训练机器人基础模型的路线。

事件概述

近期,基于GPT-6架构的Astra模型展示了强大的通用机器人控制能力。无需针对特定机器人进行专门训练,Astra仅通过摄像头视觉输入和自身推理,即可控制售价约150美元的SO-101机械臂完成金门大桥绘画、根据人类演示视频学习新任务(Physical ICL),甚至构建高保真的Real2Sim仿真环境。这一表现引发了关于“机器人领域的OpenAI可能就是OpenAI自己”的行业讨论,而非此前备受关注的Physical Intelligence或Skild等专门公司。

核心信息与技术细节

1. 通用模型的控制能力验证

  • 多任务执行: Astra不仅能规划落笔轨迹并实时修正以绘制金门大桥,还能通过观察人类操作视频,一次性学会并复现新任务。此外,它能处理相机标定、场景重建及物理参数,将真实环境迁移至MuJoCo模拟器。
  • 复杂操作测试: 在连接Kinova Gen3机械臂和Shadow Hand五指手后,Astra能协调握笔姿态、摩擦力及接触点,成功画出毕加索风格的鸽子。
  • 实机抓取数据: RoboCurve团队将Astra接入两只I2RT YAM机械臂,执行“将红色积木放入碗中”的任务。在20次测试中,Astra成功19次(成功率95%),显著优于Fable 5.1模型的8次成功。

2. 架构分工:高层规划与底层控制的结合

  • 分层控制逻辑: Astra负责理解环境、判断目标位置(x, y, z, yaw, pitch, roll)及夹爪状态,而底层的逆运动学(IK)系统负责将末端执行器的目标转换为具体的关节动作。这种分工证明了通用AI模型可作为高层决策者。
  • 实时性瓶颈: 当尝试让Astra直接以50Hz频率输出Unitree Go1四足机器人的关节目标时,由于推理速度无法满足毫秒级实时控制需求,物理模拟被迫暂停,最终250次推理仅支撑了约5秒的行走。这表明大模型目前难以直接接管高频底层控制。

3. 性能局限:“最后一毫米”难题

  • 精细操作短板: 在“将圆形拼图嵌入凹槽”的测试中,Astra的成功率骤降至10%(20次仅成功2次)。虽然模型能准确定位并移动零件至目标附近,但在涉及精确对齐、摩擦力和力反馈的“最后一毫米”操作中表现不佳。
  • 行业对比: Physical Intelligence等公司指出,通用模型在拿起工具等粗粒度操作上表现良好,但在M3螺丝对准、线缆插入等需要精细接触的任务中,仍需依赖在线强化学习或传统控制策略进行优化。

值得关注

  • 路线之争: OpenAI曾于2018年因机器人数据获取困难而关闭机器人团队,如今通过积累的语言、视觉和Agent知识,试图以通用模型“绕回”机器人领域。这挑战了Physical Intelligence和Skiled等主张从头训练专用机器人基础模型的公司路线。
  • 未来形态: 业界观点认为,未来的机器人系统更可能是“Astra负责理解与规划 + 低层策略负责稳定执行”的混合架构,而非单一模型通吃所有层级。同时,能够匹配强大AI“大脑”的物理身体硬件仍是当前发展的关键制约因素。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。