Google 科学家提出视频世界模型:两张 A100 低成本破解具身智能真机试错困局
2026/07/27 10:30阅读量 2
在 RSS 2026 上,Google 科学家 Sherry Yang 提出利用可控视频生成模型(World Gym)作为真实世界的低成本“替身”,让机器人在云端完成评估和强化学习训练,仅需两张 A100。基于世界模型的评估结果与真机强相关,且通过 World Gymnast 项目,机器人能从失败状态中学习自我恢复,显著优于传统模拟器。
事件概述
在 RSS 2026 机器人顶级学术会议上,来自 Google 实验室和纽约大学的助理教授 Sherry Yang 发表了题为《在世界模型中评估与提升物理代理》的演讲。她指出,具身智能当前最大的瓶颈是真实世界中高昂的物理交互和试错成本,导致机器人无法像 AlphaGo 或大语言模型那样在海量数据中自我进化。她提出的解决方案是:用可控的视频生成模型(World Gym)替代真实环境,在云端实现无限次低成本演练。
核心信息
- World Gym(世界模型):采用可扩展的 Diffusion Transformer 架构,通过接收前序图像和当前控制指令持续生成未来视频画面。仅用 2 张 A100 GPU 即可在 Bridge 数据集上训练出泛化能力出色的模型。该模型能在 22 种机器人形态的数据集上生成与真机动作高度一致的视频。
- 低成本云端评估:将现有主流策略(如 Octo、OpenVLA、RT-1)放入世界模型进行滚动测试。例如“把茄子放进锅里”任务中,世界模型能清晰区分各策略的真实水平,并检测到可能损坏真机的超出分布动作。世界模型还允许通过图像编辑定制任意安全测试(如插入电脑屏幕命令去拔胡萝卜),发现策略模型易被干扰物误导。实验证明世界模型的评估结果与真机实测成功率呈强正相关。
- World Gymnast(强化学习训练):利用世界模型作为强化学习环境,机器人可以从任意失败画面开始,通过视觉语言模型作为奖励信号,在线更新策略。这使机器人学会从错误状态中自我恢复。在未见过的全新留存任务(开门、关门、放茄子等)上,经过世界模型RL训练的模型表现显著优于监督微调和传统物理模拟器。
- 未来数据飞轮:提出“内环”与“外环”混合飞轮——内环是世界模型中的低成本虚拟任务RL进化;外环是机器人自主探索产生失败数据,用于更新世界模型,形成正反馈循环。同时互联网上大量第一视角人类视频可作为端到端控制先验,桥接“广度”与“精度”。
关键问答
Q: 当策略模型动作超出世界模型分布导致世界模型崩溃时,如何打破僵局?
A: Sherry Yang 表示,利用真机自主探索产生的失败数据优先更新世界模型,使其理解“新分布”,随后世界模型就能产生正确信号继续指导策略模型,形成相互促进的飞轮。
