从打球机器人看Physical AI路线之争:物理模型并未退场,而是换了一种角色

2026/08/23 12:37阅读量 3

银河通用人形机器人在世界人形机器人运动会开幕式上完成网球对打,背后系统LATENT采用动力学随机化训练。对比MIT、DeepMind、Berkeley HITTER、Sony AI Ace等多个打球机器人系统,文章指出物理模型并未被神经网络取代,而是从在线控制迁移至仿真训练、参数分布等环节;真正分歧在于“已知规律”与“学习”的边界,数据效率决定分工。

事件概述

8月22日晚,第二届世界人形机器人运动会开幕式上,银河通用将人形机器人带进「冰丝带」网球场,与人类运动员进行真实对抗。现场三轮对拉中,「银河·星仔」每轮一来一回均超过20次;与郑洁的单打展示里,机器人完成了正手、反手、底线移动和连续回球。

该机器人背后的系统,是清华大学、银河通用等团队今年公开的LATENT。研究团队从不完整的人类网球运动片段中提取运动先验,再让强化学习策略在仿真中修正和组合这些技能,最终使Unitree G1能面对不同方向和落点的来球调整全身运动,并与人类维持连续回合。

核心信息:物理模型没有消失,只是位置变了

从MIT到Sony AI Ace,各打球机器人系统的技术路线显示,物理模型并未被神经网络取代,而是从在线控制迁移至仿真训练、参数分布等角色。真正的分歧在于如何划分“已知规律”与“学习”的边界,数据效率决定分工。

  • MIT 2025年高速乒乓球机械臂(Sangbae Kim团队):仍将球的飞行动力学和机械臂约束直接写进模型预测控制,物理模型用于实时决策。
  • Google DeepMind 2024年竞技乒乓球系统:采用ABB IRB 1100六自由度机械臂加线性滑轨,击球动作由学习策略给出,但策略在复杂仿真环境中训练,通过系统辨识和sim-to-real设计支撑,物理模型移至仿真训练阶段。
  • Berkeley HITTER:采用中间路线,上层model-based planner负责球轨迹预测和球拍目标规划,下层强化学习全身控制器负责29个关节的协调,曾与人类打出最长106拍连续回合。
  • LATENT:不再追求精确复刻现实,而是通过动力学随机化定义参数分布,如球地恢复系数在0.71—0.79之间随机、空气阻力系数在0.01—0.04之间取值,使策略对现实参数漂移鲁棒。物理模型从提供精准答案变为定义“合理世界”的边界。
  • Sony AI Ace(2026年4月发表于《Nature》):核心控制方法被称为model-free reinforcement learning,但整套系统仍包含球的空气动力学、旋转、碰撞、机器人运动约束和优化器。Ace对elite选手五场赢三场,对professional选手两场全败但赢下其中一局。

值得关注:三层分工与数据效率

打球机器人任务可拆为三层:球飞行规律(低维稳定,适合显式模型)、球拍碰撞(时间短、参数敏感,靠仿真加随机化覆盖)、人形全身控制(高维约束多,强化学习搜索更高效)。不同系统在这三层上的分工各异,核心判断标准是:对某部分能力,方程、数据、算力哪种最便宜。重力、摩擦等已知规律用方程表达成本极低;29自由度人形正手动作难以手工设计,RL在仿真中试错更高效。

所谓“model-free RL”在完整机器人系统中容易产生误解:策略优化本身不依赖可滚动预测的模型,但训练过程仍高度依赖包含刚体动力学、碰撞、摩擦和执行器模型的仿真器。学习真正替代的不是物理知识,而是“每次行动都由工程师显式计算物理结果”这件事。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。