IJCAI 2026:AC²-VLA提出动作指挥计算,VLA推理加速1.79倍且不降精度
针对具身智能中VLA模型推理速度慢的痛点,IJCAI 2026收录论文AC²-VLA提出将“动作”作为计算调度的核心信号,而非仅依赖视觉复杂度。该框架通过统一路由器动态分配认知缓存复用、Token剪枝和层跳过策略,在降低29.4%计算量的同时,使推理速度提升1.79倍,并在SIMPLER基准上实现了成功率从74.8%到76.8%的提升。
事件概述
具身智能领域广泛关注的视觉-语言-动作(VLA)模型面临部署难题:由于每个控制时刻需运行庞大的视觉语言骨干网络,导致推理延迟高、实时控制频率难以保证。现有高效化方案多聚焦于视觉侧优化(如剪枝视觉Token或跳过Transformer层),但忽略了“视觉复杂度不等于控制难度”这一关键矛盾。
近日,IJCAI 2026收录了一篇题为《Action-Context-Aware Adaptive Computation for VLA models》(简称AC²-VLA)的论文。作者于闻达等人提出了一种新的自适应计算框架,核心创新在于将动作从单纯的输出端移至调度端,利用动作上下文来指导计算资源的分配,从而在不牺牲精度的前提下显著提升推理效率。
核心机制:动作驱动的统一路由
AC²-VLA 的核心架构包含一个统一的路由器(Router),它接收视觉观测、语言指令嵌入以及上一时刻的动作信息,生成动作先验条件向量,并据此决定当前时刻的计算策略。该路由器协同控制以下三个机制:
- 认知缓存复用(Cognition Caching):当动作状态稳定且视觉匹配时,直接复用上一帧的VLM骨干网络输出特征,跳过完整的骨干网络计算,直接将特征送入Action Head生成动作。
- Token剪枝(Token Pruning):基于动作上下文对视觉Token打分。例如在机械臂接近目标进行精细夹取时,保留夹爪附近的高权重Token;在大范围移动阶段,则丢弃无关区域的Token以缩短序列长度。
- 层跳过(Layer Skipping):根据任务阶段动态调整Transformer网络的深度。不同阶段(如接触阶段vs移动阶段)可能调用完全不同的层序号组合,即使总层数相同,实际参与计算的层也不同。
这三个机制由同一个训练过的路由器统一调度,区别于以往独立使用启发式规则的方法,实现了更智能的资源分配。
训练策略:自蒸馏确保泛化性
为解决任务成功率信号稀疏且离散、难以用于实时监督的问题,AC²-VLA采用**自蒸馏(Self-Distillation)**策略:
- Teacher模型:使用在Open X-Embodiment数据集上训练好的稠密策略(Dense Policy,即未稀疏化的原始模型)。
- Student模型:经过稀疏化处理的AC²-VLA框架。
- 目标:让Student模仿Teacher的动作输出和骨干网络特征表示。
这种设计赋予了框架良好的可迁移性,更换VLA骨干网络时只需重新进行蒸馏流程,无需为特定任务单独调参。
实验结果与性能分析
AC²-VLA基于CogACT模型构建,在SIMPLER高保真仿真基准上进行评测,主要结论如下:
- 精度提升:在Google Robot Visual Matching设定下,平均成功率达到76.8%,优于稠密基线CogACT的74.8%及RT-2-X的46.3%。其中Drawer Opening任务成功率从71.8%提升至80.6%。
- 效率飞跃:计算量(FLOPs)降至原始模型的29.4%,实际端到端推理速度提升1.79倍,为同类方法中的当前最优水平。
- 消融实验验证:
- 移除缓存复用:成功率降至70.5%,加速比降至1.66倍。
- 移除层跳过:成功率跌至67.4%。
- 移除Token剪枝:速度降至1.52倍。
- 三者共同作用才能达到最优的速度-精度平衡。
- 意外收益:在特定缓存阈值(τcache = 0.2)下,缓存复用不仅加速,还将成功率推高至87.1%。研究认为这是因为逐帧推理易放大高频噪声导致动作抖动,而复用特征起到了平滑决策的作用。
行业意义
AC²-VLA 的意义在于范式转变:让动作反过来指导模型“看哪里”、“想多少”以及“哪些可复用”。这不仅解决了边缘设备显存和算力受限导致的落地难问题,还为后续探索动作先验在安全性和鲁棒性方面的应用(如检测观测与动作不一致时的回退重计算)提供了新思路。
