蔚来发布MM-Future:让自动驾驶同时推演多组“场景-动作”联合未来
蔚来与中科大团队联合发布论文《MM-Future》,提出一种多模式世界—动作联合模型,旨在解决自动驾驶规划中单一轨迹预测的局限。该模型通过一次生成多组“场景-动作”假设并实现双向交互,在NAVSIM等基准测试中显著提升了规划指标(PDMS达94.0),验证了多模式联合建模的有效性。尽管计算成本较高且存在隐式表征可解释性问题,该方法标志着世界模型从单纯的未来预测向深度参与规划决策演进。
事件概述
近日,任少卿指导发布的最新论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》提出了一种新的多模式世界—动作联合模型。该研究由蔚来智能驾驶基础模型预研团队与中国科学技术大学合作完成,旨在解决自动驾驶系统中如何同时处理多种可能未来及对应动作的问题,使车辆具备类似老司机的“走一步想十步”能力。
核心技术与创新
1. 突破现有World-Action Model局限
现有的世界-动作模型主要分为两类:
- 级联式方案:先生成候选轨迹再预测未来,或反之。缺陷在于信息单向传递,后生成的变量无法修正前面的决策。
- 联合式方案:场景和动作在同一过程中生成,具备双向交互能力,但通常只生成单组结果。
真实道路需要同时覆盖多种驾驶结果并保持场景与动作的双向耦合。MM-Future的核心思路是:一次生成多组“配对场景-动作假设”。每一组内部,车辆轨迹与对应的未来场景共同演化,最终从中选择最安全的路径。
2. 解决三大技术门槛
- 多样性生成:针对真实数据仅记录单一结果的局限,模型在动作端建立高斯混合噪声(Gaussian Mixture Noise),在场景端使用独立噪声,构建不同驾驶结果的独立起点。训练时采用“Best-of-Many”监督策略,避免所有候选被拉向相似结果。
- 计算成本控制:提出MM-Tokens机制,将多摄像头、多时间帧的视觉特征压缩为面向规划的紧凑表示。该Token不重建RGB图像或完整BEV,而是保留道路结构、路口、前车等关键规划信息,大幅降低多候选展开的计算量。
- 共同演化与筛选:使用模态感知Transformer(modality-aware Transformer)同时处理动作流和场景流,共享注意力机制实现双向交互。生成结束后,由Future-Conditioned Proposal Scorer评估每条候选轨迹及其专属预测未来,选出得分最高的轨迹执行。
实验结果与性能分析
1. 基准测试表现
在NAVSIM和HUGSIM基准上,MM-Future展现了显著优势:
- NAVSIM-v1 navtest:获得94.0 PDMS,高于DriveFuture (90.7) 和 DrivoR (93.7)。
- NAVSIM-v2:获得91.5 EPDMS,高于UniTeD (90.1) 和 DriveFuture (89.9)。
- 消融实验:仅生成动作时PDMS为84.1;增加至32种模式提升至92.3;加入场景-动作联合生成后达92.9;引入配对未来评分后进一步提升至93.3。这表明多模式数量、联合生成及未来条件评分均带来稳定增益。
2. 收敛速度与效率
多模式训练表现出更快的收敛速度。16模式和32模式达到0.80验证PDM分数仅需约3.8k steps,而单模式需17.5k steps。
3. 闭环测试与局限性
- HUGSIM测试:平均HD-Score为32.3,高于Latent-WAM (28.9) 和 UniAD (28.6),但在极端难度下表现略逊于Latent-WAM。
- 计算开销:主模型采样64组候选时,在单张NVIDIA H800上的端到端前向延迟约为233ms。候选数量增加会显著提升延迟,需在覆盖范围与计算成本间平衡。
- 可解释性:MM-Tokens属于隐式表征,目前难以直接观察模型保留了哪些具体规划信息。团队计划增加辅助感知模块以提升透明度。
行业意义
MM-Future代表了自动驾驶世界模型角色的深化:从单纯的“未来预测”走向“规划决策”。以往多模式规划主要关注“可以走哪几条轨迹”,而MM-Future将其扩展为“采取不同轨迹后,环境分别可能怎样变化”。随着蔚来NWM系统已部署超95万辆车,该技术路线展示了从生成多条轨迹到同时生成多组动作与未来联合结果的演进方向,但仍需在真实道路复杂场景和计算效率上进一步验证。
