小鹏发布第二代 VLA 6.3.0:引入时间维度记忆与预判,9月推送

2026/08/27 21:36阅读量 2

小鹏汽车于8月27日发布第二代视觉-语言-动作(VLA)模型全新版本6.3.0,核心突破在于引入“时间”概念,通过Infini-VLA记住过去30秒路况,利用X-Foresight预判未来6秒场景。该版本将面向所有Ultra和Ultra SE车型推送,单图灵芯片Max车型可获得Lite蒸馏版。同时,小鹏重构车端大脑架构,强调“汽车即机器人”理念,并计划将同一套基座模型应用于L2驾驶辅助与L4 Robotaxi。

事件概述

8月27日,小鹏汽车举办物理AI分享会,正式展示第二代 VLA(Visual-Language-Action,视觉-语言-动作)模型的全新版本 6.3.0。此次更新的核心逻辑是让自动驾驶系统具备“时间线”感知能力,即结合历史记忆与未来推演进行决策,而非仅依赖单帧画面。该版本将于9月开始向用户推送。

核心技术升级

1. 引入时间维度的决策机制
新版 VLA 通过三个关键模块实现“在时间里开车”:

  • Infini-VLA(记忆过去):底层架构支持更长时序处理,量产版设置为回溯过去30秒的路面状况。例如,在前车掉头场景中,模型能理解这是一个持续行为,而非孤立瞬间,从而避免误判空位而加速。
  • Streaming Inference(流式自回归推理):实现边获取输入、边推理、边输出轨迹,无需等待完整历史分析完毕。据称此举使决策速度提升300%,类似人类眼脑手并行的反应模式。
  • X-Foresight & Flow Matching(预判未来):基于历史状态对未来6秒进行推演,拟合多种可能的轨迹分布,帮助模型选择更优动作,体现“防御性驾驶”逻辑。

2. 模型规模与训练闭环

  • 参数量扩大:新一代模型参数量较此前扩大3.5倍,旨在处理如轮渡码头无车道线、狭窄山路悬空树枝等长尾极端场景(Corner Case),而非依赖固定规则补丁。
  • 数据与仿真:单次训练数据吞吐量达1亿个视频片段。建立向量化数据检索系统,将真实问题转化为“错题集”。仿真验证效率大幅提升,6月至沟通会前两周,每日仿真验证的新模型数量增长290%
  • 安全提升:官方数据显示,新版本在仿真和测试中的综合安全能力提升超过20倍

产品落地计划

  • Ultra/Ultra SE 车型:9月起推送第二代 VLA 完整版,小鹏 G9L Ultra 与 Ultra SE 首发搭载。
  • Max 车型:针对算力受限的单图灵芯片 Max 车型,推出第二代 VLA Lite 蒸馏版。通过 Hybrid ViT 重新设计视觉部分以保留大模型底层能力,同样于9月开启首批推送。

战略定位:汽车即机器人

小鹏通用智能中心负责人刘先明提出“Car as Robot”(汽车即机器人)概念,认为汽车与具身智能机器人在感知、记忆、意图理解和动作执行上本质相同。

  • 架构重构:车端大脑采用 Omni 全模态模型结合 Master Agent,从单一任务执行转向理解连续对话目标,实现从座舱语义到驾驶域执行的连贯决策。
  • 技术复用:同一套基座模型将同时用于 L2 驾驶辅助与 L4 Robotaxi。目前小鹏 Robotaxi 内测订单超2000单,且获得广州市远程测试资质,可进行主驾无安全员道路测试。
  • 行业趋势:随着新能源汽车进入红海竞争,车企纷纷转向“物理 AI”或“具身智能”叙事,试图通过前沿技术开发构建新的资本故事与技术壁垒。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。