面壁智能发布首个具身智能成果 MiniCPM-Robot 系列,开源两款轻量 VLA 与跟踪模型

2026/07/22 13:47阅读量 2

面壁智能联合 OpenBMB 在 WAIC 2026 上发布并开源了首个具身智能系列 MiniCPM-Robot,包含通用 VLA 模型 MiniCPM-RobotManip(1.5B)和移动跟踪模型 MiniCPM-RobotTrack(0.9B)。前者在上下文记忆任务上大幅领先主流模型,推理成本减半;后者支持纯本地断网部署,真机跟踪帧率达 5+ Hz。两个模型均已开源。

事件概述

7 月 19 日,面壁智能联合 OpenBMB 在世界人工智能大会(WAIC 2026)“智在终端 惠及千行”分论坛上正式发布并开源了首个具身智能成果——MiniCPM-Robot 系列模型。该系列包含两个具身智能模型:通用 VLA 模型 MiniCPM-RobotManip 和面向移动机器人跟踪导航的 MiniCPM-RobotTrack

核心信息

MiniCPM-RobotManip(通用 VLA)

  • 规模:1.5B 参数,基于多模态端侧模型 MiniCPM-V 4.6 训练。
  • 性能:综合性能位列 VLA 模型第一梯队,与 Qwen-VLA、π0.5 等相近。在考验上下文记忆的 RMBench 基准上得分 53,远高于 π0.5(10 分)。支持 1 分钟具身原生记忆,可完成需多步记忆的操作(如按顺序揭开不同颜色方块)。
  • 计算优势:视觉 Token 极致压缩带来流式推理低成本。在含 60 帧历史观测的任务中,流式推理仅需 3.3 TFLOPs(传统方式需 125 TFLOPs),低于 π0.5 无历史帧的 5.0 TFLOPs。H100 BF16 下单决策步推理时延 120ms,为 π0.5(234ms)的一半。

MiniCPM-RobotTrack(跟踪模型)

  • 规模:0.9B 参数,端到端视觉指令跟踪模型,由面壁智能与南京大学合作研发。
  • 特性业内首个支持真实本地断网部署的跟踪模型,仅依靠机器狗原装摄像头和本地算力即可完成指令追踪。
  • 评测:在单目标(STT)、动态多目标(DT)和模糊目标(AT)三类任务中追踪率分别达 89.8、73.4 和 80.4,均取得开源方案最优,相比 OmTrackVLA 提升 7.0、14.6 和 6.5 个百分点。与闭源模型 TrackVLA++ 相比(纯 SFT 设定),单目标和模糊目标追踪率提升 8.8 和 17.0 个百分点。
  • 自进化数据管线:通过自动检测、人工复核及 DAgger 策略,在仿真与真机交互中主动补充高价值样本,提升复杂动态环境下的跟踪能力。
  • 真机实测:在宇树 Unitree Go2 原生算力下稳定达到 5+ Hz,端到端响应时延约 180 毫秒。断网后仍能自主完成目标识别、跟踪与运动控制。
  • 开源:提供完整部署流程与一键启动脚本,支持纯本地部署、开箱即用。

PhyAI 推理框架支持

两款模型均获得 PhyAI 框架的推理支持。PhyAI 面向 Physical AI 的端侧推理与云端 Rollout 设计,在 NVIDIA RTX 5090 上运行 π0、π0.5 和 GR00T 分别加速约 2.85 倍、1.82 倍和 2.28 倍。针对 MiniCPM-Robot 定制融合算子(RMSNorm+SiLU gate、conv1d+SiLU+QKV split 等),在 H20 上推理帧率可达 36.77 Hz。

产业合作

面壁智能已与乐聚机器人合作推出展厅导览和园区巡检 Agent 解决方案,并与吉利汽车围绕 VLA 模型及生产仓储应用展开合作。

开源地址

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。