清华、北理工与自变量联合开源 HOST:29 秒人类视频即可让机器人学会新技能
自变量机器人联合北京理工大学、清华大学发布并开源单样本技能获取框架 HOST。机器人仅需观看约 29 秒的人类演示视频,即可在不更新模型参数、不采集新数据的情况下执行新任务,在 50 项未见过的桌面操作任务中成功率达 62%,且不会遗忘旧技能。
事件概述
8月3日,自变量机器人与北京理工大学、清华大学联合发布并开源了 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion)。该框架让机器人仅凭一段平均 29 秒的人类演示视频,即可学会执行全新任务,无需模型微调或新数据采集。
核心信息
- 在放水果、堆碗、擦盘子、插笔等 50 项训练阶段从未见过的桌面操作任务中,HOST 的技能复现成功率达到 62%。
- 相比当前主流的 Pi-0.5 + 微调方案,所需数据量减少至 1/50,学习时间缩短至 1/507,成功率显著领先。
- HOST 在推理时不修改模型权重,因此不会出现“学新忘旧”。论文数据显示,微调方案(Wall-OSS+SFT)学习新技能后,旧任务表现下降至原来的 43%;HOST 则几乎完整保留所有已掌握技能。
技术要点
HOST 的核心转变是从“动作模仿”转向“结果推理”:机器人不再试图模仿人类的肢体动作,而是观察人类完成后的结果状态,反推自己需要执行的动作序列。其处理流程分为三步:
- 任务阶段判断:识别当前视频中的任务进度,例如“切菜阶段还是炒菜阶段”。
- 视角迁移:将人类执行后的画面转换为机器人自身视角和本体结构下的画面,弥合人机身体结构差异。
- 动作反推:从目标画面反推并执行动作序列,即使物品位置被移动也能重新规划。
针对人与机器人执行速度不同步的问题,HOST 采用“按任务进度对齐”策略,将视频帧与机器人操作映射到同一向量空间,并通过动态时间规整(DTW)建立对应关系。对齐误差从基于时钟时间对齐的 0.079 降至 0.006,使普通人不刻意放慢动作的随手视频也能作为教学素材。
HOST 的技术底座是带视觉预测功能的级联策略模型,采用双专家混合架构,分两阶段训练:先在 193,462 条机器人同体轨迹数据上预训练(覆盖 229 项任务),再用 5,847 条人类-机器人配对演示数据进行微调,实现从机器人跟随机器人到机器人跟随人类的跨本体迁移。
意义与局限
论文、代码和模型权重已全部开源至 GitHub 和 Hugging Face。团队表示,开源旨在将机器人技能获取从依赖专业人员反复采集数据、训练模型的流程,转变为普通人通过一段视频即可完成教学的方式。
HOST 仍有局限:62% 的成功率意味着近四成场景下机器人会失败,且测试任务以桌面操作为主,复杂动态场景表现尚待验证。但它证明了在 Scaling Law 主导 AI 叙事的当下,算法创新同样可大幅降低数据依赖,为具身智能行业提供了一条不同于“堆数据”的路径。
