自动驾驶转向“物理AI”:从分模块规则到世界模型预测
自动驾驶行业正从分段式感知与规则决策,转向以“物理AI”为核心的统一架构:系统先理解场景、预测接下来几秒的物理世界,再执行驾驶决策。特斯拉、Momenta、小鹏、蔚来、华为等玩家已陆续将相关方案落地到量产车或试点场景,竞争焦点也从传感器和算力转向数据规模、仿真真实度与模型能力。文章同时指出,真实数据覆盖不足、仿真迁移不完美以及安全验证难度加大仍是明确瓶颈。
事件概述
过去近十年,自动驾驶主要依靠分模块软件串联:摄像头和传感器识别物体,另一个程序预测物体行为,再由第三个程序选择路径。这种方式在熟悉场景下表现尚可,但每经过一个模块都会丢失信息,遇到意外情况时容易失效。
当前行业正在转向“物理AI”——软件不仅标记看到了什么,还会在行动前对运动、因果关系和可能发生的未来进行推理。NVIDIA(英伟达)CEO Jensen Huang(黄仁勋)在2026年CES上称:“物理AI的ChatGPT时刻已经到来——机器开始理解、推理并在现实世界中行动。”他认为这一机会规模达数万亿美元,自动驾驶是其中最早的大规模应用方向。
技术演进已经逐步落地。特斯拉(Tesla)2024年在北美发布的FSD v12,用单个神经网络取代大量手写规则,直接输入摄像头图像并输出转向和刹车指令,证明统一架构可在大规模车队上运行。中国供应商和车企在2024至2025年跟进类似方案。早期版本虽然让驾驶更流畅、减少了部分故障,但出问题时难以检查。
随后两条技术路线逐渐成型:一是增加类人的场景理解层,不仅识别行人,还判断其移动意图,部分设计可响应语音目标;二是“世界模型”,学习物理环境的基本规律,在车内做数秒内的短时模拟并选择更安全的路径。到2026年,多数领先方案已把这两种思路结合使用,理解当下和预测近未来不再被对立看待。
核心信息
- 特斯拉:继续扩展统一神经网络,增加推理能力,并在仿真环境中进行闭环训练。
- Momenta:R7系统于2026年进入量产车,并扩展到苏州部分区域(含夜间线路)的无人配送货车。其公司资料称,同一核心模型基于超过120亿公里真实驾驶数据训练,支持乘用车和物流车,且无需依赖逐街精细预制地图。
- 小鹏汽车(XPeng):在2026年某重要计算机视觉会议上介绍了一种系统,可在车辆执行操作前先建立交通演变的内部草图。
- 蔚来(NIO):已在其大部分车队中陆续部署多个版本的预测模型。
- 华为(Huawei):智驾软件通过云端大系统生成困难练习场景,车载端使用较小模型进行实时决策。
竞争标准也随之改变。早期竞争围绕传感器数量、车载芯片算力和标注数据规模;现在则取决于核心模型对物理行为的理解质量、训练所用真实数据的多样性,以及可演练罕见场景的仿真环境真实度。拥有大规模车队的公司在数据上占优,资本雄厚的公司可购买更多仿真和训练算力,小团队面临更高门槛。
现状与挑战
- 即使有数百亿公里真实驾驶数据,仍难以充分覆盖各种罕见情况;数字化仿真可扩展场景数量,但仿真中学到的经验不一定能完美迁移到真实道路。
- 模型必须在量产车的功耗和成本约束下快速运行。
- 系统透明性下降,安全验证变得更加困难。
- 公开讨论中的“物理AI公司”和“基础模型”更多是方向性描述,而非成熟产品。更高级别自动化仍在限定或已测绘区域扩张,开放道路上完全无人的驾驶仍限于试点。
值得关注
更深层的变化在架构层面。一旦模型能模拟物理后果,同一套核心软件原则上可同时支持驾驶、座舱功能,以及后续操作物体的机器人。多家车企已将驾驶、座舱和机器人研究团队拉近,共享模型开发。短期竞争仍是更安全、更强大的汽车;长期竞争是谁能构建最有效的“物理世界模型”。
物理AI并没有消除自动驾驶的难题,而是重构了问题。成功不再依赖写出更细的规则,而是取决于数据、算力和工程能力——也就是教会机器理解世界真实运动方式的能力。掌握这种训练能力的公司,将决定行业下一阶段的节奏。当前需要人类监督的系统与可靠的无需人类监督的系统之间差距仍然很大,填补这一差距所需的资源还在持续增加。
