自变量机器人发布 HOST:机器人看一段视频就能学会新技能
2026/08/03 17:00阅读量 2
自变量机器人联合北理工、清华发布并开源 HOST 框架,让机器人仅观看一段数十秒的人类演示视频即可学会新技能,无需更新模型参数。在 50 项新任务测试中平均成功率达 62%,技能获取时间较传统微调方案缩短约 507 倍,并能有效避免灾难性遗忘。
事件概述
自变量机器人(自变量)联合北京理工大学、清华大学发布了一套名为 HOST(Human-to-robot One-Shot Skill AcquisiTion)的机器人学习框架。该框架使机器人只需观看一段平均 29 秒的人类演示视频,即可在无需重新收集遥操作数据、无需更新模型参数的情况下,当场学会一项新任务。
核心机制
- 进度对齐而非时间对齐:HOST 将人类视频和机器人动作映射到同一向量空间,使用动态时间规整算法按任务进度自动对齐,避免因人类与机器人执行速度不同导致的步骤偏差。该方法将进度误差从 0.079 降低到 0.006,缩小了一个数量级。
- 双专家 MoT 架构:模型分为“视觉大脑”和“动作大脑”。视觉大脑负责理解视频进度、推断机器人视角下应出现的画面;动作大脑则根据目标画面生成机器人动作。这使机器人不再直接模仿人类肢体动作,而是从执行结果反推动作,绕开跨形态模仿的难题。
- 两阶段预训练:第一阶段使用 193,462 条机器人轨迹和 229 项任务的机器人数据,建立任务理解和动作想象能力;第二阶段加入 5,847 段人类任务视频与机器人轨迹的配对数据,实现从人类视频学习的能力迁移。
测试表现
- 在 50 项训练阶段未见过的新任务中,HOST 均有成功记录,仅观看一次演示视频后平均成功率达 62%。
- 相比传统监督微调(SFT)方案,所需示范数量降至五十分之一,技能获取时间缩短约 507 倍。
- 在抗遗忘测试中,经验证的旧任务保留率显著优于微调基线:π0.5+SFT 仅保留原表现的 17%,Wall-OSS+SFT 保留 40%,而 HOST 因不改变模型参数,旧任务表现几乎不受影响,比最佳微调基线高出 59 个百分点。
- 鲁棒性测试中,光照变化导致成功率下降 1 个百分点、替换物体下降 4 个百分点、更换场景下降 6 个百分点、执行中移动物品下降 9 个百分点(最终仍达 53%),表明模型具备动态规划能力,而不是简单背动作序列。
开源信息与背景
HOST 的核心代码和论文已全面开源:
- 论文:https://arxiv.org/abs/2607.20033
- GitHub:https://github.com/CGuangyan-BIT/HOST
- Hugging Face:https://huggingface.co/papers/2607.20033
自变量机器人成立于 2023 年底,此前已发布具身大模型 WALL-B、世界模型 WALL-WM,并开源 VLA 模型 WALL-OSS-0.5;自研量子一号、量子二号机器人本体,并与 58 到家合作推进家政场景落地。HOST 是该公司在“快速学习新技能”方向上的又一技术补充,通过开源推动开发者生态建设。
