29位具身智能CEO共识:泛化是最大瓶颈,数据与场景决定落地节奏
2026/08/27 16:14阅读量 2
在2026世界机器人大会(WRC2026)上,近30位具身智能企业负责人达成共识:泛化能力不足是当前规模化复制的最大技术瓶颈,提升泛化依赖海量高质量数据与真实场景积累。市场估值逻辑正从单纯看“泛化想象力”转向通过出货量、订单质量及数据飞轮等代理变量进行间接定价。尽管方向一致,但在技术路线上存在显著分歧,VLA(视觉-语言-动作模型)与世界模型孰优孰劣仍是争论焦点,且关于Scaling Law能否直接迁移至物理AI领域仍有质疑声音。
事件概述
在2026世界机器人大会(WRC2026)主论坛中,宇树科技、京东集团、科沃斯、星动纪元等29家具身智能企业的创始人或高管围绕“泛化能力”展开深入讨论。行业普遍认同泛化性是制约具身智能从实验室走向大规模商业应用的核心障碍,但不同企业在定义量化、技术路径选择及落地策略上存在明显差异。
核心信息
1. 泛化的定义与量化标准分化
业界对“泛化性”的理解尚未统一,主要形成三种视角:
- 成本视角:星海图将泛化性等同于“培训成本”,即新任务的后训练时长。其目标是将长程任务后训练时间从10小时压缩至1小时甚至更低。
- 维度拆解视角:跨维智能将其拆分为语义泛化(认知行为智能,依赖人类数据)和物理泛化(环境变化下的稳定性,依赖仿真合成数据)。智澄AI则提出任务、环境、本体三维乘法叠加框架,指出数据需求呈指数级增长。
- 系统效率视角:Arm认为高级机器人应在特定工作流(如物流、仓储)中实现跨对象泛化,通过软件、模型、技能层面的复用降低工程改造成本。
2. 数据规模与质量是破局关键
数据缺口被视为当前最紧迫的问题,头部企业提出了宏大的数据规划:
- 量级差距:京东集团指出,训练通用大脑需千万小时级数据,而当前行业仅拥有十万小时量级。京东计划采集1000万小时人类数据+100万小时真机数据,其JoyAI-RA模型随数据量增加,泛化成绩显著提升。
- 金字塔结构:光轮智能提出以“100亿小时具身数据”为基础泛化目标,其中真机数据仅占0.1%,其余依靠仿真与人类数据补充。
- 感知基础:帕西尼强调触觉作为稳定模态的重要性,主张通过保障数据原生同构和高保真度来支撑泛化;章鱼动力则展示了机电手环实现跨个体零标定泛化的突破。
3. 技术路线分歧:VLA vs 世界模型 vs 类脑架构
关于如何实现强泛化,主流观点存在三条路径之争:
- VLA(视觉-语言-动作模型):星动纪元和无界动力认为VLA通过模仿学习形成的泛化有限,难以实现任务级零样本泛化,更多依赖数据分布和概率涌现。
- 世界模型:星动纪元、自变量机器人及极佳视界看好世界模型对物理常识的理解能力,认为其有望实现任务级泛化,但北京飞渡科技指出多物理场耦合求解等技术难点仍需多年攻克。
- 类脑/其他架构:智平方强调类脑架构NeuroVLA在能效比上的优势;英飞凌提出功能迁移与知识存储以降低对新数据的依赖。
4. 落地节奏:从工业/服务向家庭渐进
针对落地场景,业界形成了清晰的阶段性判断:
- 三角矛盾:墨奇智能指出工业追求极致效率与准确率,家庭追求极致泛化性,两者存在矛盾。因此建议先从酒店保洁等服务场景切入,积累数据后再进入家庭。
- 脏活苦活先行:奥比中光和维他动力均认为应从人类不愿从事的复杂场景入手,随着泛化能力提升逐步渗透。
- 风险度量:维他动力提出以“失效成本”参数化定义不同场景的危害等级,产品需先经沙箱测试再逐步授权。
5. 市场估值逻辑转变
随着宇树科技上市,资本市场对具身智能的定价逻辑发生变化:
- 不再为想象付费:市场不再单纯为“泛化想象力”支付溢价。
- 代理变量定价:券商研报显示,估值开始挂钩四个代理变量:出货量、订单质量、技术路线收敛度(已收敛环节稳定估值,未收敛环节高期权)、数据飞轮(优先奖励能获取真实场景数据的企业)。
值得关注
- Scaling Law的物理适用性质疑:科沃斯董事长钱东奇提出尖锐质疑,认为语言模型的Scaling Law建立在人类语言积累之上,尚无证据表明其可直接泛化至物理AI。他提出“碳硅一体”的变通方案,即在物理AI真正成熟前,由人类智能补偿机器人空缺。
- ChatGPT时刻的定义:宇树科技王兴兴定义具身智能的“ChatGPT时刻”为在80%陌生环境中,通过语音/文字指令完成80%左右任务,预计快则2-3年,慢则5-10年。
- 基座模型的速度优势:自变量机器人声称其基座模型可在3个月内打通新场景全链条,远快于海外同行两年半的周期,体现了大模型泛化带来的效率红利。
