星动纪元陈建宇:VLA 并非终局,具身大脑正走向世界模型时代
2026/08/21 11:14阅读量 2
在 WRC 2026 上,星动纪元创始人兼 CEO 陈建宇提出,VLA 主要依赖模仿学习,面对新任务时泛化能力有限;以视频为基础的世界模型能够理解物理世界规律并预测未来演化,更可能成为下一代具身智能的核心范式。他同时介绍了星动纪元在世界动作模型、全直驱灵巧手及物流工业场景商业化上的进展。
事件概述
在 WRC 2026 大会上,星动纪元创始人兼 CEO 陈建宇发表观点:VLA 不是具身智能的终局,世界模型可能成为下一代核心范式。他认为,VLA 的问题不在端到端训练本身,而在于其几乎完全依赖对人类行为数据的模仿,面对从未见过的新场景、新任务时难以真正泛化。世界模型则尝试构建对物理世界的常识性理解,并预测未来状态演化,具备更强的泛化潜力。
具身大模型的三代范式
- 第一范式:语言模型 + 机器人控制。 早期将语言大模型用于上层规划,下层仍是传统模块化感知、控制与执行,模块间依赖人工定义接口,无法端到端训练。
- 第二范式:多模态底座上的 VLA。 以多模态语言模型为底座,统一视觉、语言和动作输出,代表包括 Google 的 PaLM、RT 系列。星动纪元称其是该方向最早公开发表论文的团队之一,相关工作于 2024 年发布。
- 第三范式:世界模型 / 世界动作模型。 除预测动作外,还预测物理世界未来状态的演化,形成闭环。陈建宇认为,以视频为底座的世界模型比语言底座更适合具身模型,因为原始图像与视频包含更丰富的物理细节。
关键成果与能力
- 2024 年发布全球首个融合视频预测与动作预测的世界动作模型,称比英伟达同类方案早约一年。
- 构建大规模人类行为数据集,融合机器人真机数据与第一人称人类操作数据;与 FAIR 团队合作推进 ControlNet 相关工作,并用真实世界反馈进行迭代强化学习。
- 模型能力包括:复杂物理现象精准预测、零样本任务级泛化,以及叠纸盒、翻袜子、脱鞋、开瓶等精细操作;同时具备跨本体使用工具的能力,例如操作螺钉枪和移液器。
硬件与商业化
- 星动纪元对整机、关节模组、灵巧手及电机、减速器、驱动器等实现全栈自研。全尺寸人形机器人已于 2023 年底具备涉水行走、上下楼梯等能力,并在今年春节期间发布舞剑演示。
- 灵巧手采用全直驱方案,响应速度快,每秒可点击鼠标 10 次,具备反驱抗冲击能力,负载达 24kg。
- 商业化从物流工业场景起步,逐步向服务、C 端和家用渗透。B 端客户项目已覆盖十余个城市,在物流分拣等场景常态化运行;星动纪元同时开放硬件本体、API 与软件工具链,支持二次开发和生态研究。
