具身智能仍在“前GPT时代”:WAIC 2026揭示路线未收敛、工程落地尚早
WAIC 2026上具身智能演示看似接近实用,但一线从业者判断显示该领域仍处于GPT-3出现前的阶段:统一框架未形成,数据、表征、闭环三大障碍使物理世界Scaling Law难以复制;当前主流端到端范式VLA缺少语言能力,路线之争仍在继续;从演示到工业落地还需大量工程化,预计2027-2028才可能出现能力涌现,通用场景比预期更慢。
事件概述
WAIC 2026展台上机器人演示叠衣服、冲咖啡、切菜等任务,但多位核心从业者指出,行业实际进度远不及展台画面所展现的。面壁智能姚远将当前阶段比作2018年的大模型(BERT、GPT、T5路线并存),认为统一框架尚未收敛;腾讯张正友形容最智能的AI仍是“缸中之脑”,无法在持续变化的环境中一边行动一边接收反馈并调整。
核心障碍:物理世界Scaling Law难以复制
智元机器人联合创始人姚卯青归纳了三道墙:
- 数据墙:真实交互数据稀缺且昂贵
- 表征墙:跨任务、跨场景、跨本体的统一表征尚未形成
- 闭环墙:真实试错代价高、反馈慢
面壁智能姚远则从模块成熟度划分:语言模型最成熟,多模态感知约70-80%,行动模块仅约40%。两人结论一致:Scaling Law在物理世界不能简单复制,因为互联网文本可累积,而机器人物理交互数据不会天然存在,统一表征比文本tokenization复杂得多,试错不可回滚且成本高。
路线之争:尚未收敛
目前至少有三条路线并行:
- VLA(视觉-语言-动作端到端):姚卯青指出VLA缺少语言能力,无法做长程任务规划和判断。
- 世界模型:通过预测物理状态变化来指导决策。
- 智元提出的WRAM(世界推理动作模型):整合世界模型与语言推理能力。
张正友主张认知系统、感知行动系统、底层反应系统分层协同,不同模块在不同频率运行(底层反应需100赫兹以上,感知行动10-15赫兹),而VLA将前后模块放在同一频率下,与物理世界交互时反馈跟不上。
姚卯青还指出,当前底层组件(Tokenizer、Encoder)均来自VQA和对话模型,并非为具身任务原生设计,行业仍在使用“改装发动机”,预计需百万小时级数据才能发展出原生架构。
从演示到工业落地:工程量巨大
展台演示与工厂现实之间存在显著差距:
- 博世智能科技刘敏:工厂要求99.8%准确率、节拍6秒为门槛。
- 智元在南昌3C工厂:首批项目需数月进行硬件软件集成、MES系统对接、通宵压测,一个月连续测试后才上主产线;从零到一需三四个月,产品化后才会缩短至一两周复制一个点。
- 越疆科技刘培超:机器人至少20个关节,行业通用要求5万小时MTBF,但大部分机器人目前可能连10小时MTBF都达不到。
- 灵巧手可靠性更差:姚卯青提到灵巧手“采集数据一两周就出问题,每工作半小时要散热”,核心零部件未达到汽车行业16949标准。
艾欧智能丁哲章观察到,今年讨论“落地”的需求明显增加,但实际落地案例并未同步增长,场景方预期与模型和本体的实际能力之间存在断层。他提出“渐进式落地”:机器人做一部分,人监管一部分,接受中间状态。腾讯云黄阳认为长尾效应明显,技术快速推进至60-80%,但最后20%需要大量时间填补。
多位从业者给出了接近但不算近的时间线:
- 姚卯青:2027年底到2028年初可能出现较强的涌现时刻。
- 面壁智能刘知远:端侧模型还需1-3年。
- 丁哲章:类比自动驾驶——十年前宣称2025年L5,十年后仅为“差不多可用”,具身智能也会经历预期修正。
- 张正友:具身智能需要类似ChatGPT的节点,即真正能依赖、稳定做事的系统。
- 光轮智能杨海波:今年是“跑通”年,明年才能“算账”;预测明年本体价格降至今年十分之一,稳定性提高百倍,但软件、数据、评测等基础设施缺口不会随硬件改善自动消失。
综合判断:短期(今明两年)为特定场景工程跑通,中期(2027-2028)可能出现能力涌现,通用具身智能从工厂进入家庭将远慢于多数人预期。
