大晓机器人联合港大发布StreamPI:为VLA模型注入连续时序理解能力

2026/08/28 15:17阅读量 2

大晓机器人(ACE ROBOTICS)与香港大学联合发布StreamPI,旨在解决视觉-语言-动作(VLA)模型长期存在的“单帧智能”瓶颈。该研究通过流式推理、指令持续锚定及随机时间间隔训练等技术,使模型能够利用跨帧历史信息进行连续物理决策,而无需增加额外参数。实验数据显示,StreamPI在LIBERO、CALVIN等基准测试及真实机器人任务中,显著提升了长程任务成功率、时序记忆能力及精细空间操作精度。

事件概述

大晓机器人(ACE ROBOTICS)联合香港大学发布了名为 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models)的研究成果。该工作针对当前 VLA 模型主要依赖单帧观测进行独立决策的局限性,引入了连续的时序建模机制,使机器人能够理解状态变化、记忆过去并判断任务进程,从而从“识别当前状态”迈向“理解正在发生的物理过程”。

核心技术创新

StreamPI 并未通过堆叠额外参数或引入独立视频编码器来获取时序能力,而是基于现有 VLA 骨干网络(如 π0.5),通过以下三个关键机制实现轻量化扩展:

  1. 指令持续锚定:将每个时刻组织为“视觉观测 + 任务指令”的时序单元。语言指令作为语义锚点贯穿始终,确保机器人在接收新信息时仍能明确当前目标,避免长程执行中指令被视觉信息稀释。
  2. 流式推理(Streaming Inference):采用键值缓存机制,首帧编码后存入缓存,后续决策仅处理新到来信息并调用历史表示,避免对全窗口历史进行重复计算,降低推理开销。
  3. 随机时间间隔训练(Random-Interval Streaming Training):通过随机改变历史观测间的时间距离及隐藏部分早期信息,使模型适应真实世界中相机采集、通信和执行带来的延迟与时序波动,提升对不完整上下文和不同时间跨度的鲁棒性。

实验验证与性能表现

仿真环境基准测试

  • LIBERO 数据集
    • 三帧输入场景下,平均成功率从 96.4% 提升至 97.5%。
    • 五帧输入场景下,平均成功率从 97.0% 提升至 98.3%。
    • 在依赖长程上下文的 LIBERO-Long 任务中,成功率从 π0.5 的 92.4% 提升至 95.0%。
  • CALVIN 数据集
    • 平均连续任务长度达到 4.547,优于 π0.5 (4.313) 和 MemoryVLA (4.090)。
    • 在任务推进至第五步时,成功率保持 85.0%,高于 π0.5 的 79.5%。

真实机器人任务验证

团队设计了四项真机任务,每项采集 100 条人类遥操作示范,结果如下:

任务类型具体任务π0.5 成功率StreamPI 成功率提升幅度
时序记忆猜杯子 (Shell Game)46.7%80.0%+33.3%
运动趋势判断滚动物体抓取26.7%63.3%+36.6%
精细空间感知窄瓶口插笔40.0%66.7%+26.7%
精细空间感知纸杯插入杯套60.0%92.0%+32.0%

值得关注

StreamPI 证明了在不增加模型参数的前提下,通过重构注意力机制和引入流式时序建模,可以显著增强 VLA 模型的时空智能。这种机制不仅解决了“物体在哪里”的空间问题,更通过理解“世界正在发生什么”的时间维度,提升了机器人在动态物理世界中的泛化能力和操作精度。未来,团队计划探索超过 100 帧的高效时序训练及自适应缓存裁剪技术,以应对更长跨度、更复杂的真实场景。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。