物理AI重塑智驾:VLA与世界模型融合成主流路线
2026年被称为物理AI元年,智能驾驶从模块化、端到端演进至VLA+世界模型融合路线,特斯拉FSD V14验证了二者结合。行业竞争从参数堆叠转向物理世界理解与行动的底座能力,但真实世界数据不足和算力高门槛仍是主要挑战。
事件概述
2026年被称为“物理AI元年”。物理AI浪潮下,智能驾驶正从“看见什么做什么”的应激模式,向“想象接下来会发生,再主动行动”的预测模式演进。CES上英伟达CEO黄仁勋宣布物理AI进入“ChatGPT时刻”倒计时,GTC大会上将其定义为继数字AI之后的下一个万亿级增长浪潮。宇树科技、智元机器人、优必选等持续出货,标志着AI正从数字世界的“思考”转向物理世界的“行动”。
技术演进
智能驾驶的技术路线经历了多次范式转换:
- 早期模块化:依赖规则算法与高精地图,感知、预测、决策、控制分而治之,系统泛化能力弱,无法达到拟人化水平。
- 端到端:2024年3月,特斯拉推送FSD V12,将感知、决策与控制整合为单一神经网络,移除30万行手写代码,实现“端到端”。国内随后分为“一段式”与“两段式”两派,目前一段式已成主流。
- VLA:早期端到端是“黑箱”,存在可解释性问题。行业转向VLA(视觉-语言-行动模型),通过融合计算机视觉、自然语言处理与强化学习,构建统一智能体,使决策逻辑可解释。
- 世界模型:VLA受限于语义训练,难以应对复杂突发场景;世界模型直接模拟物理世界运行规律,可预测未来,但研发难度大。
- 融合方案:2026年特斯拉FSD V14集成xAI的Grok大模型,同时利用世界模型进行数据生成与闭环仿真,验证了VLA+世界模型深度融合的可行性。小鹏发布的X-Mind将预测性世界模型内嵌为VLA模型的视觉思维链;蔚来1月已将世界模型+闭环强化学习架构推送至数十万辆车;地平线6月底发布HSD V2.0,采用世界模型+端到端强化学习双引擎。
行业共识
华为车BU CEO靳玉志认为VLA类似“背题库的学生”,在复杂或突发场景容易失效,更倾向WA(World-Action)路径;Momenta CEO曹旭东也指出VLA训练侧重语义,与自动驾驶的实际需求存在偏差。但特斯拉FSD V14改变了行业认知,黑芝麻智能CEO单记章表示,VLA+世界模型是智能驾驶未来最有可能的路线。当前该融合方案已成为多数车企的选择。
竞争逻辑转变
越来越多智驾公司重新定位为“物理AI企业”:特斯拉从汽车公司转型为AI公司;理想汽车定位为人工智能企业;小鹏定位为“物理AI世界的出行探索者”与具身智能公司;Momenta被称为“物理AI第一股”;轻舟智航转向“通用物理AI”;卓驭科技转向“移动物理AI”。
物理AI时代的竞争逻辑从“堆配置”(激光雷达数量、芯片算力、续航里程)转向“建底座”(物理世界理解与行动能力)。同时,世界模型推动智驾、座舱与机器人技术底座融合:特斯拉用同一基础模型驱动FSD和Optimus;理想合并基座模型与VLA研发团队;高通将汽车与机器人业务放入同一事业群。
落地方面:华为ADS 5.0搭载WEWA 2.0,云端引入Multi-Agent多智能体群体博弈;Momenta R7世界模型量产首发;蔚来NWM是中国首个智驾世界模型。
挑战与展望
尽管路线逐渐清晰,距离物理AI终极形态仍有较大距离:
- 真实世界数据不足:截至2026年5月,特斯拉FSD(监督版)车队累计行驶突破100亿英里(约160亿公里),位居全球第一;其他新势力品牌累计里程多在数十亿公里量级。
- 算力门槛高:特斯拉可能握有约23万张H100等效算力;小鹏Robotaxi瞄准L4,搭载4颗图灵AI芯片,车端算力达3000TOPS;华为2026年乾崑智驾研发投入预计超180亿元,未来5年将至少投入700亿元用于AI算力提升,算力规模在29个月周期内增长21倍。
正如莫拉维克悖论所示,对人类容易、对AI困难的物理感知问题依然存在。2026年作为物理AI上半场,自动驾驶仍是车企角逐焦点,但距离真正的终极形态还有相当长的路。
