具身智能仍在“前GPT时代”:WAIC 2026揭示路线未收敛、工程落地尚早

2026/07/20 10:54阅读量 2

WAIC 2026上具身智能演示看似接近实用,但一线从业者判断显示该领域仍处于GPT-3出现前的阶段:统一框架未形成,数据、表征、闭环三大障碍使物理世界Scaling Law难以复制;当前主流端到端范式VLA缺少语言能力,路线之争仍在继续;从演示到工业落地还需大量工程化,预计2027-2028才可能出现能力涌现,通用场景比预期更慢。

事件概述

WAIC 2026展台上机器人演示叠衣服、冲咖啡、切菜等任务,但多位核心从业者指出,行业实际进度远不及展台画面所展现的。面壁智能姚远将当前阶段比作2018年的大模型(BERT、GPT、T5路线并存),认为统一框架尚未收敛;腾讯张正友形容最智能的AI仍是“缸中之脑”,无法在持续变化的环境中一边行动一边接收反馈并调整。

核心障碍:物理世界Scaling Law难以复制

智元机器人联合创始人姚卯青归纳了三道墙:

  • 数据墙:真实交互数据稀缺且昂贵
  • 表征墙:跨任务、跨场景、跨本体的统一表征尚未形成
  • 闭环墙:真实试错代价高、反馈慢

面壁智能姚远则从模块成熟度划分:语言模型最成熟,多模态感知约70-80%,行动模块仅约40%。两人结论一致:Scaling Law在物理世界不能简单复制,因为互联网文本可累积,而机器人物理交互数据不会天然存在,统一表征比文本tokenization复杂得多,试错不可回滚且成本高。

路线之争:尚未收敛

目前至少有三条路线并行:

  • VLA(视觉-语言-动作端到端):姚卯青指出VLA缺少语言能力,无法做长程任务规划和判断。
  • 世界模型:通过预测物理状态变化来指导决策。
  • 智元提出的WRAM(世界推理动作模型):整合世界模型与语言推理能力。

张正友主张认知系统、感知行动系统、底层反应系统分层协同,不同模块在不同频率运行(底层反应需100赫兹以上,感知行动10-15赫兹),而VLA将前后模块放在同一频率下,与物理世界交互时反馈跟不上。

姚卯青还指出,当前底层组件(Tokenizer、Encoder)均来自VQA和对话模型,并非为具身任务原生设计,行业仍在使用“改装发动机”,预计需百万小时级数据才能发展出原生架构。

从演示到工业落地:工程量巨大

展台演示与工厂现实之间存在显著差距:

  • 博世智能科技刘敏:工厂要求99.8%准确率、节拍6秒为门槛。
  • 智元在南昌3C工厂:首批项目需数月进行硬件软件集成、MES系统对接、通宵压测,一个月连续测试后才上主产线;从零到一需三四个月,产品化后才会缩短至一两周复制一个点。
  • 越疆科技刘培超:机器人至少20个关节,行业通用要求5万小时MTBF,但大部分机器人目前可能连10小时MTBF都达不到。
  • 灵巧手可靠性更差:姚卯青提到灵巧手“采集数据一两周就出问题,每工作半小时要散热”,核心零部件未达到汽车行业16949标准。

艾欧智能丁哲章观察到,今年讨论“落地”的需求明显增加,但实际落地案例并未同步增长,场景方预期与模型和本体的实际能力之间存在断层。他提出“渐进式落地”:机器人做一部分,人监管一部分,接受中间状态。腾讯云黄阳认为长尾效应明显,技术快速推进至60-80%,但最后20%需要大量时间填补。

多位从业者给出了接近但不算近的时间线:

  • 姚卯青:2027年底到2028年初可能出现较强的涌现时刻。
  • 面壁智能刘知远:端侧模型还需1-3年。
  • 丁哲章:类比自动驾驶——十年前宣称2025年L5,十年后仅为“差不多可用”,具身智能也会经历预期修正。
  • 张正友:具身智能需要类似ChatGPT的节点,即真正能依赖、稳定做事的系统。
  • 光轮智能杨海波:今年是“跑通”年,明年才能“算账”;预测明年本体价格降至今年十分之一,稳定性提高百倍,但软件、数据、评测等基础设施缺口不会随硬件改善自动消失。

综合判断:短期(今明两年)为特定场景工程跑通,中期(2027-2028)可能出现能力涌现,通用具身智能从工厂进入家庭将远慢于多数人预期。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。