IJCAI 2026:AC²-VLA提出动作指挥计算,VLA推理加速1.79倍且不降精度

2026/08/26 14:09阅读量 3

针对具身智能中VLA模型推理速度慢的痛点,IJCAI 2026收录论文AC²-VLA提出将“动作”作为计算调度的核心信号,而非仅依赖视觉复杂度。该框架通过统一路由器动态分配认知缓存复用、Token剪枝和层跳过策略,在降低29.4%计算量的同时,使推理速度提升1.79倍,并在SIMPLER基准上实现了成功率从74.8%到76.8%的提升。

事件概述

具身智能领域广泛关注的视觉-语言-动作(VLA)模型面临部署难题:由于每个控制时刻需运行庞大的视觉语言骨干网络,导致推理延迟高、实时控制频率难以保证。现有高效化方案多聚焦于视觉侧优化(如剪枝视觉Token或跳过Transformer层),但忽略了“视觉复杂度不等于控制难度”这一关键矛盾。

近日,IJCAI 2026收录了一篇题为《Action-Context-Aware Adaptive Computation for VLA models》(简称AC²-VLA)的论文。作者于闻达等人提出了一种新的自适应计算框架,核心创新在于将动作从单纯的输出端移至调度端,利用动作上下文来指导计算资源的分配,从而在不牺牲精度的前提下显著提升推理效率。

核心机制:动作驱动的统一路由

AC²-VLA 的核心架构包含一个统一的路由器(Router),它接收视觉观测、语言指令嵌入以及上一时刻的动作信息,生成动作先验条件向量,并据此决定当前时刻的计算策略。该路由器协同控制以下三个机制:

  1. 认知缓存复用(Cognition Caching):当动作状态稳定且视觉匹配时,直接复用上一帧的VLM骨干网络输出特征,跳过完整的骨干网络计算,直接将特征送入Action Head生成动作。
  2. Token剪枝(Token Pruning):基于动作上下文对视觉Token打分。例如在机械臂接近目标进行精细夹取时,保留夹爪附近的高权重Token;在大范围移动阶段,则丢弃无关区域的Token以缩短序列长度。
  3. 层跳过(Layer Skipping):根据任务阶段动态调整Transformer网络的深度。不同阶段(如接触阶段vs移动阶段)可能调用完全不同的层序号组合,即使总层数相同,实际参与计算的层也不同。

这三个机制由同一个训练过的路由器统一调度,区别于以往独立使用启发式规则的方法,实现了更智能的资源分配。

训练策略:自蒸馏确保泛化性

为解决任务成功率信号稀疏且离散、难以用于实时监督的问题,AC²-VLA采用**自蒸馏(Self-Distillation)**策略:

  • Teacher模型:使用在Open X-Embodiment数据集上训练好的稠密策略(Dense Policy,即未稀疏化的原始模型)。
  • Student模型:经过稀疏化处理的AC²-VLA框架。
  • 目标:让Student模仿Teacher的动作输出和骨干网络特征表示。

这种设计赋予了框架良好的可迁移性,更换VLA骨干网络时只需重新进行蒸馏流程,无需为特定任务单独调参。

实验结果与性能分析

AC²-VLA基于CogACT模型构建,在SIMPLER高保真仿真基准上进行评测,主要结论如下:

  • 精度提升:在Google Robot Visual Matching设定下,平均成功率达到76.8%,优于稠密基线CogACT的74.8%及RT-2-X的46.3%。其中Drawer Opening任务成功率从71.8%提升至80.6%。
  • 效率飞跃:计算量(FLOPs)降至原始模型的29.4%,实际端到端推理速度提升1.79倍,为同类方法中的当前最优水平。
  • 消融实验验证
    • 移除缓存复用:成功率降至70.5%,加速比降至1.66倍。
    • 移除层跳过:成功率跌至67.4%。
    • 移除Token剪枝:速度降至1.52倍。
    • 三者共同作用才能达到最优的速度-精度平衡。
  • 意外收益:在特定缓存阈值(τcache = 0.2)下,缓存复用不仅加速,还将成功率推高至87.1%。研究认为这是因为逐帧推理易放大高频噪声导致动作抖动,而复用特征起到了平滑决策的作用。

行业意义

AC²-VLA 的意义在于范式转变:让动作反过来指导模型“看哪里”、“想多少”以及“哪些可复用”。这不仅解决了边缘设备显存和算力受限导致的落地难问题,还为后续探索动作先验在安全性和鲁棒性方面的应用(如检测观测与动作不一致时的回退重计算)提供了新思路。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。