李飞飞、Yilun Du罕见联手:用像素动作接口直接复用视频生成模型,机器人无需专属大模型
斯坦福李飞飞、哈佛Yilun Du等学者合作发表论文《Masked Visual Actions for Unified World Modeling》,提出用“像素遮罩轨迹”作为统一接口,让机器人直接复用现有视频生成模型完成世界模拟与动作生成。仅用15小时数据微调开源模型Wan2.2,即可实现跨机械臂泛化,挑战了机器人专属基座模型的产业主流路线。
事件概述
近日,一篇题为 Masked Visual Actions for Unified World Modeling 的论文在 arXiv 上公开。署名作者包括斯坦福大学李飞飞、吴佳俊、Gordon Wetzstein,哈佛大学助理教授 Yilun Du,ControlNet 作者张吕民,机器人基础模型推动者黄文龙等十多位学者。李飞飞与 Yilun Du 此前在具身智能路线上长期存在学术分歧,这次罕见同署,被视为两条路线可能达成共识的信号。
核心方法
论文提出 MVA(Masked Visual Actions),核心思路是:不再让机器人训练专属动作模型,也不把关节角度等低层控制量直接喂给视频模型,而是把动作“翻译”成视频模型天然理解的像素遮罩轨迹。
具体分为三步:
- 用 SAM 提取遮罩轨迹:利用 Meta 的 Segment Anything Model 将画面中的机器人和操作物体分割出来,随时间变化形成两组运动轨迹。动作不再表示为角度、坐标或速度,而是色块在画面中的连续位移。
- 遮住一条轨迹,让模型补全:遮住物体轨迹、保留机械臂轨迹时,模型扮演“世界模拟器”,推演物体将如何运动;遮住机械臂轨迹、保留物体轨迹时,模型反推机械臂应当如何行动。同一个模型、同一套参数,只靠遮住不同轨迹即可切换两种能力。
- 基于现成视频模型微调:直接使用阿里开源视频生成模型 Wan2.2(140 亿参数,基于扩散 Transformer 架构),仅用 LoRA 微调,训练数据只有 15 小时,实现了 zero-shot 泛化,而非从头训练新模型。
关键结果
- 在同款机器人上,MVA 的 LPIPS 指标为 0.0945,对比方法 Ctrl-World 为 0.362,生成画面与真实画面差距缩小近四倍。
- 从单臂机器人训练数据迁移到未见过的双臂机器人时,Ctrl-World 失效,MVA 仍能输出可靠预测。
- 论文还展示了三种用法:为已有策略打分、作为规划器进行“想象-筛选”规划、根据任务直接反推动作。
产业视角
论文另一个被产业界重点关注的细节是 URDF 的引入。
URDF 是机器人行业通用的运动学描述文件,记录关节数量、角度范围、连杆长度等参数。MVA 借助 URDF 引入正运动学(FK)和逆运动学(IK)解算,先确定末端执行器应到达的位置,再反算各关节如何配合。这区别于主流 VLA 策略直接输出与特定本体绑定的低层动作表征,使得同一套模型可以跨不同机械臂泛化,有效解决“换一条机械臂就失效”的异构本体迁移问题。
此外,URDF 的运动学约束也限制了视频生成模型“天马行空”的输出,使其生成的机器人姿态必须是真实可执行的。
从行业趋势看,具身智能正逐渐将“视觉理解”和“动作控制”拆开:前者利用互联网海量视频训练,后者用相对少的机器人数据加运动学计算补齐。MVA 恰好落在这一趋势的接口上。论文结论指向一个判断:机器人或许不需要专属大模型,直接复用成熟的视频生成模型,只需找到正确的接口即可。
