人类视频到机器人动作还差一座桥:IJCAI 2026综述提出“表示桥梁”框架

2026/08/07 14:09阅读量 2

IJCAI 2026 上,来自清华、港科大、微软亚洲研究院等机构的综述论文,系统梳理了人类视频驱动机器人学习的四条技术路线,指出其本质都是在人类视频与机器人动作之间搭建表示桥梁。论文提出四条路线可叠加而非互斥,并点出视频分割、本体差异、评测基准三大开放难题。访谈中,论文一作冯志远认为世界模型研究逻辑更完整,但距具身智能的GPT-3.5时刻仍很遥远。

在 IJCAI 2026 上,来自清华大学、香港科技大学、微软亚洲研究院等机构的团队发表了一篇综述论文,重新审视“人类视频如何赋能机器人学习”。论文提出一个统一观点:无论采用哪种技术路线,本质上都是在人类视频与机器人动作之间搭建一座“表示桥梁”(representation bridge)。

为什么需要人类视频:机器人训练数据依赖真实机器人执行并记录轨迹,成本高、效率低,且与特定硬件强耦合。人类视频规模大、成本低、场景丰富,如 HowTo100M 收录超过1.36亿个视频片段,Ego4D 超过3600小时第一视角视频。但人类视频缺少机器人可直接执行的标签、没有本体感知(关节角、末端状态),人手运动与机器人控制接口不兼容。

四条技术路线

论文将现有方法归纳为四条路线,区别在于把监督信号加在哪一层:

  • 潜在动作:让模型从视频中“发现”动作,代表工作 LAPA(ICLR 2025)。无需动作标签,但可解释性差,监督信号在隐空间难以验证;高度压缩的离散 token 能否表达高自由度灵巧操作仍是开放问题。
  • 显式2D:提取手部关键点、物体框、点轨迹、2D pose 等。代表工作 ATM、Magma、Gemini Robotics。缺少深度信息,遮挡下易失效,多作为辅助监督信号。
  • 显式3D:使用 MANO 模型恢复手部三维轨迹,代表工作 EgoVLA、H-RDT、Being-H0、VITRA。对齐质量高,但3D标注成本高、野外重建精度有限,且需要从2D图像推断3D结构。目前在 VLA 训练中更多作为“必要的辅助监督”。
  • 世界模型:先预测未来帧再反推动作。早期代表 GR-1,GR-2 用3800万条视频片段预训练;新范式 WAM(World Action Model)在世界模型骨干上加动作解码专家。逻辑完整,但视觉 token 生成计算成本高,知识蒸馏到动作预测仍未充分解决,实际效果未达理论预期。

核心判断

四条路线并非互斥竞争,而是“把桥墩打在哪个位置”的区别。训练世界模型时可叠加3D关键点轨迹作为辅助 loss,VLA 系统也可加入2D轨迹辅助任务。业界较合理的组合是:VLA 训练中3D轨迹监督作为必选,2D轨迹作为补充;世界模型视情况叠加像素级或 latent 级监督。

研究界对世界模型期待更高,但工业界目前效果更好的 demo 多来自 VLA+RL,泛化性仍有限。冯志远认为,机器人操作还没有类似 Transformer + 大规模预训练这样的“配方”,因此“具身智能的GPT-3.5时刻”可能还很远。

三个开放难题

  1. 视频切割:现有基于固定时间窗口切割,但 YouTube、Ego4D 等视频中旁白与动作对齐松散,同样视觉过渡可能对应不同动作意图。应转向以操作阶段和物体状态变化为边界的语义分割。
  2. 本体与视角差异:高自由度人手映射到低自由度机械臂是欠约束问题,人类动作未必能由机器人实现,不同人动作可能对应同一机器人指令。第三人称视频与机器人固定相机视角也有本质差异。方向是使用以交互结果为锚点(如物体状态变化)的表示。
  3. 评测基准:LIBERO、CALVIN、SIMPLER 等基准任务多样性和长时程结构不足,可能无法预测真实部署。建议追踪不同机器人数据预算下的迁移效率、量化视角与本体迁移的鲁棒性,并在匹配数据/计算预算下对比有无人类视频预训练的影响。

访谈主要观点

  • 人类数据不会取代机器人数据:大规模人类数据用于预训练学习通用操作能力,机器人数据用于后训练做本体适配。
  • 最大鸿沟仍是本体差异;未来灵巧手和头戴相机让机器人视角更接近人类采集视角,可从硬件层面降低 mapping 难度。
  • 最看好世界模型:先预测未来状态再反推动作,轨迹更收敛,且天然适合大规模视频预训练;但当前实际效果有限。
  • 现阶段应优先学习动作轨迹,把能力从“四五十分提升到七八十分”;物理规律建模等模型水平更高后再解决。
  • 微软亚洲研究院在具身方向约一年半,聚焦用人类传感器数据做灵巧手操作,不自己造硬件,通过开源(如 VITRA)影响研究路线。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。