面壁开源1.5B/0.9B通用VLA模型,机器狗断网也能跟人跑
2026/07/20 11:36阅读量 2
面壁智能在WAIC期间开源MiniCPM-Robot系列,含1.5B操作模型和0.9B跟踪导航模型,在多个评测中进入第一梯队。MiniCPM-RobotManip在RMBench记忆测试中得分约53(π0.5仅10),单帧推理延迟约120ms。MiniCPM-RobotTrack在宇树Go2机器狗上本地运行,无网环境下也能稳定跟踪。同步开源推理框架PhyAI,可加速VLA模型部署。
事件概述
面壁智能于WAIC期间正式发布并开源MiniCPM-Robot系列模型及具身智能推理框架PhyAI。该系列包含两个模型:
- MiniCPM-RobotManip:1.5B参数量,通用VLA模型,用于控制机械臂执行操作任务(如做三明治)。
- MiniCPM-RobotTrack:0.9B参数量,负责机器人跟踪与导航,让机器人依据自然语言指令在动态环境中持续跟随目标。
核心能力与表现
MiniCPM-RobotManip
- 在LIBERO、Calvin、RoboTwin2等主流VLA评测中,整体表现与π0.5等模型处于同一梯队。
- 记忆力优势:能将历史观测和已执行动作纳入判断,在专门考察上下文记忆的RMBench中得分为约53分(π0.5约10分,接近随机)。这对完成叠衣服、收拾桌面等长链任务至关重要。
- 低延迟:H100、bf16精度下单帧决策延迟约120毫秒,接近π0.5(234毫秒)的一半。
- 通过压缩视觉Token和使用流式计算减少计算量,仅保留与任务相关的信息,支持更长历史记忆且不导致计算量暴涨。
MiniCPM-RobotTrack
- 基于MiniCPM4-0.5B,整体参数0.9B。
- 在单目标跟踪、多人干扰跟踪、模糊目标跟踪三种真实场景下,追踪率分别达89.8%、73.4%和80.4%,均属开源方案最优。相比OpenTrackVLA,三项分别提高7.0、14.6和6.5个百分点。与闭源TrackVLA++(单视角、纯SFT设定)相比,单目标跟踪高出8.8个百分点,模糊目标跟踪高出17.0个百分点。
- 无需额外目标检测或跟踪模块,仅靠宇树Go2 Edu原装摄像头和本地算力运行,端到端延迟约180毫秒,稳定达到5Hz以上。
- 采用自进化数据管线处理长尾场景(目标横穿、快速转向、短时遮挡、多人交叉等),通过闭环训练持续优化。
- 在电梯、地下停车场等弱网或无网环境下仍可正常完成目标识别和跟踪。
推理框架PhyAI
- 由明体科技联合北京邮电大学、北京大学研发,旨在缩短具身模型从实验室到真实机器人的适配时间。
- 在RTX 5090上运行π0、π0.5、GR00T时,相较官方仓库分别提速约2.85倍、1.82倍和2.28倍。
- 适配MiniCPM-Robot系列时,通过CUDA Graph将推理帧率从10.12Hz提至33.28Hz,再加入定制融合算子后在NVIDIA H20上进一步提至36.77Hz。
落地合作
- 乐聚机器人:将端侧多模态大模型与夸父机器人本体、导航系统结合,推出展厅导览Agent和园区巡检Agent。导览机器人在无网环境下可离线讲解、自由问答;巡检机器人可识别车辆违停、路面异常等,数据本地处理。
- 吉利汽车:共同训练VLA模型,通过RoboHarness框架将VLM、VLA、机器人本体和导航集成,执行仓储长程任务。框架管理长任务上下文和记忆,支持失败重试与恢复,运行数据进入数据闭环以持续优化模型。
值得关注
面壁智能强调具身智能应走“先通后专”路线,先提升基础模型的泛化性,再覆盖具体场景。MiniCPM-Robot系列在极小参数量下实现了可比的VLA性能,并解决了记忆和低延迟两大痛点,同时支持本地化断网运行。PhyAI框架则进一步降低了VLA模型的部署门槛。这一路径表明,具身智能的竞争正从单纯比拼参数量,转向更注重单位算力下的实际能力和工程效率。
