大晓机器人联合港大发布StreamPI:为VLA模型注入连续时序理解能力
2026/08/28 15:17阅读量 2
大晓机器人(ACE ROBOTICS)与香港大学联合发布StreamPI,旨在解决视觉-语言-动作(VLA)模型长期存在的“单帧智能”瓶颈。该研究通过流式推理、指令持续锚定及随机时间间隔训练等技术,使模型能够利用跨帧历史信息进行连续物理决策,而无需增加额外参数。实验数据显示,StreamPI在LIBERO、CALVIN等基准测试及真实机器人任务中,显著提升了长程任务成功率、时序记忆能力及精细空间操作精度。
事件概述
大晓机器人(ACE ROBOTICS)联合香港大学发布了名为 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models)的研究成果。该工作针对当前 VLA 模型主要依赖单帧观测进行独立决策的局限性,引入了连续的时序建模机制,使机器人能够理解状态变化、记忆过去并判断任务进程,从而从“识别当前状态”迈向“理解正在发生的物理过程”。
核心技术创新
StreamPI 并未通过堆叠额外参数或引入独立视频编码器来获取时序能力,而是基于现有 VLA 骨干网络(如 π0.5),通过以下三个关键机制实现轻量化扩展:
- 指令持续锚定:将每个时刻组织为“视觉观测 + 任务指令”的时序单元。语言指令作为语义锚点贯穿始终,确保机器人在接收新信息时仍能明确当前目标,避免长程执行中指令被视觉信息稀释。
- 流式推理(Streaming Inference):采用键值缓存机制,首帧编码后存入缓存,后续决策仅处理新到来信息并调用历史表示,避免对全窗口历史进行重复计算,降低推理开销。
- 随机时间间隔训练(Random-Interval Streaming Training):通过随机改变历史观测间的时间距离及隐藏部分早期信息,使模型适应真实世界中相机采集、通信和执行带来的延迟与时序波动,提升对不完整上下文和不同时间跨度的鲁棒性。
实验验证与性能表现
仿真环境基准测试
- LIBERO 数据集:
- 三帧输入场景下,平均成功率从 96.4% 提升至 97.5%。
- 五帧输入场景下,平均成功率从 97.0% 提升至 98.3%。
- 在依赖长程上下文的 LIBERO-Long 任务中,成功率从 π0.5 的 92.4% 提升至 95.0%。
- CALVIN 数据集:
- 平均连续任务长度达到 4.547,优于 π0.5 (4.313) 和 MemoryVLA (4.090)。
- 在任务推进至第五步时,成功率保持 85.0%,高于 π0.5 的 79.5%。
真实机器人任务验证
团队设计了四项真机任务,每项采集 100 条人类遥操作示范,结果如下:
| 任务类型 | 具体任务 | π0.5 成功率 | StreamPI 成功率 | 提升幅度 |
|---|---|---|---|---|
| 时序记忆 | 猜杯子 (Shell Game) | 46.7% | 80.0% | +33.3% |
| 运动趋势判断 | 滚动物体抓取 | 26.7% | 63.3% | +36.6% |
| 精细空间感知 | 窄瓶口插笔 | 40.0% | 66.7% | +26.7% |
| 精细空间感知 | 纸杯插入杯套 | 60.0% | 92.0% | +32.0% |
值得关注
StreamPI 证明了在不增加模型参数的前提下,通过重构注意力机制和引入流式时序建模,可以显著增强 VLA 模型的时空智能。这种机制不仅解决了“物体在哪里”的空间问题,更通过理解“世界正在发生什么”的时间维度,提升了机器人在动态物理世界中的泛化能力和操作精度。未来,团队计划探索超过 100 帧的高效时序训练及自适应缓存裁剪技术,以应对更长跨度、更复杂的真实场景。
