IJCAI 2026:S²-VLA 引入动态注意力机制,2B模型长程操控超越7B
针对具身智能中长程任务累积误差导致失败的问题,华东师范大学与上海交通大学团队提出 S²-VLA 模型。该模型通过信念状态和自适应动态门控机制,实现随任务阶段调整视觉、意图和动作注意力的权重分配。在 LIBERO-Long 基准测试中,仅 2B 参数、7GB 显存的 S²-VLA 达到 96.4% 成功率,性能超过多数 7B 及以上规模模型,且推理吞吐量高达 80.8 Hz。
事件概述
在具身智能领域,随着视觉-语言-动作(VLA)模型参数规模扩大至 7B 甚至 8.5B,语义理解能力虽有所提升,但长程操控中的稳定性问题依然突出。许多大参数模型在执行到第 10 步左右时容易因早期微小偏差的累积放大而突然失败。为此,华东师范大学与上海交通大学的研究团队提出了 S²-VLA 模型,通过引入信念状态(Belief State)和自适应动态门控机制,在不增加参数量的前提下显著提升了长程任务的执行成功率。
核心机制:从静态融合到动态调度
传统 VLA 模型通常采用静态特征融合,即在整个任务过程中固定视觉、语言和动作历史的权重比例。这种机制在短任务中表现尚可,但在长程序列中存在两大缺陷:
- 纠偏滞后:早期毫米级定位偏差无法通过提高视觉权重及时纠正,导致误差逐步累积。
- 意图丢失:子任务切换时,缺乏对高层意图的动态调整,易导致动作中断或偏离指令。
S²-VLA 的核心改进在于实现了阶段自适应的注意力分配,主要包含两个模块:
-
信念状态(Belief State):
利用轻量级循环网络实时接收上一时刻的动作历史和关节传感器反馈。该模块不直接输出动作,而是在潜空间内维持一个内部状态,用于判断当前任务进度和执行质量。它完全通过端到端预测下一个动作的损失进行间接监督,无需人工标注阶段标签,从而自发形成对“进度”和“偏差”的感知。 -
三路自适应注意力门控(SSGAA Module):
基于信念状态生成的信号,策略头的特征融合被拆分为三条平行通道,并由动态门控权重决定各通道的比重:- 局部视觉通道(Visual Cross-Attn):连接 VLM 低层视觉 Token,负责精细空间定位和对准。
- 全局意图通道(Intent Cross-Attn):连接高层语义 Token,负责子任务规划和目标理解。
- 动作自注意力通道(Action Self-Attn):建立未来多步动作间的时序关系,保持轨迹连贯。
消融实验表明,将门控机制应用于策略头中间层(如第 12 层)效果最佳,既能保持特征稳定,又能保留自适应能力。
关键发现与性能表现
通过对 31 步推理过程的分析,S²-VLA 展示了注意力权重的动态变化规律:
- 瞄准与定位阶段:视觉门控权重显著升高,模型通过增强局部视觉关注来修正空间偏差。
- 抓取与子任务切换阶段:意图门控权重上升,确保模型在夹爪闭合或目标转换时不会“忘记”后续指令。
- 稳态平移阶段:动作自注意力通道占主导,利用时序关系维持运动平滑,减少对无关视觉细节的计算消耗。
性能数据:
- 成功率:在 LIBERO-Long 基准测试中,S²-VLA 达到 96.4% 的成功率,超越了多数 7B 甚至 8.5B 参数的同类模型。
- 资源效率:模型参数量仅为 2B,推理显存占用约 7GB。
- 运行速度:吞吐量达到 80.8 Hz,远高于同类 7B 模型(通常仅几 Hz),具备在端侧设备部署的潜力。
行业意义
S²-VLA 的研究表明,在长程物理交互任务中,单纯依靠扩大参数量并非解决不稳定问题的唯一路径。阶段自适应的资源调度能力对于提升具身智能的鲁棒性至关重要。通过将高层语义理解与低层控制解耦,并结合动态注意力机制,小参数模型同样可以在复杂长程任务中实现高效、稳定的表现,为具身智能从实验室走向实际工业场景提供了新的技术思路。
