清华等联合开源RPent:构建具身智能体基础设施,GPT-6 Astra真机测试成功率超92%
2026/09/21 14:22阅读量 2
清华大学、无问芯穹及正行创新联合发起的具身智能体基础设施RPent正式开源。该系统采用模块化架构,将通用大模型的任务规划能力与VLA专家模型的精细操作相结合,并引入记忆机制与Flash Mode加速推理。在LIBERO-PRO基准测试中,结合GPT-6 Astra的RPent达到92.6%的任务成功率,端到端任务完成速度优化7倍以上,展示了从数字智能向物理世界执行演进的基础设施能力。
事件概述
由清华大学、无问芯穹(Wu Wen Intelligence)和正行创新联合发起的具身智能体基础设施 RPent 正式开源。该项目旨在解决通用大模型进入物理世界时面临的感知、决策、执行及反馈闭环问题,通过模块化设计连接大模型、专家模型、工具库与真实机器人硬件,推动具身智能体从“执行固定指令”向“持续学习与进化”转变。
核心技术与架构
RPent 并非简单的端到端控制框架,而是采用分层解耦的开放模块化架构,主要包含以下核心组件:
-
四层模块化设计:
- 用户层:提供交互式CLI和Web Dashboard,支持实时查看推理过程、视觉输入及动作轨迹。
- 智能层:由 Agentic Planner(智能规划器)和 Action Primitive(动作原语)组成。规划器结合基础模型、Memory(记忆系统)和Tool Library进行任务拆解;动作原语封装VLA、WAM等学习型模型及程序化技能,实现高精度执行。
- 接口层:统一连接模型服务与机器人环境,支持跨设备迁移,新增硬件只需实现标准接口即可接入。
- 环境层:兼容LIBERO-PRO、RoboCasa、RoboTwin等仿真环境,以及Franka、YAM、SO101等真实机器人设备。
-
统一接口体系:
- 通过 MCP(Model Context Protocol)统一描述可调用能力。
- 利用 RPC 实现工具、模型服务与机器人环境的独立部署与通信。
- 使用 MHS(Machine Hardware Standard)面向物理设备提供统一读写与控制抽象,使智能体能像调用数字工具一样调用物理能力。
-
Memory 记忆机制:
- 将经验按复用范围组织为三层记忆,记录适用范围、类型、可信度及支撑证据。
- 引入 Recipe(可迁移任务方案),而非固定坐标,确保在物体位置变化时智能体能重新观察并复用逻辑。
- 支持记忆资产分发,单个智能体的成功经验可同步至其他智能体,促进系统整体进化。
-
Flash Mode 加速推理:
- 针对重复性任务,将探索阶段验证成功的流程压缩为 Task Card(任务卡)。
- 在执行阶段优先调用Task Card,仅在环境偏离或检查失败时重新调用大模型规划,避免高成本推理。
关键性能数据
在多项基准测试中,RPent 展现了显著的性能优势,特别是结合 GPT-6 Astra 模型时:
-
LIBERO-PRO 基准测试:
- 任务成功率:达到 92.6%,相比第二名(RPent/Opus-4.7,82.4%)高出10.23个百分点,相比π_RLinf(50.0%)高出42.63个百分点。
- 执行速度:开启 Flash Mode 后,平均执行时间从 283.6秒 降低至 40.9秒,实现约 7倍加速,成功率仅下降3.5个百分点。
- 扰动适应能力:在位置交换任务中,引入记忆机制后成功率从 31.0% 提升至 87.0%。
-
其他榜单表现:
- RoboCasa365 Target50(厨房长程任务):RPent/GPT-6 Astra 达到 59.20%,位列第一。
- LIBERO:RPent/Opus-4.7 达到 96.0%。
- RoboTwin:RPent/GPT-5.5 达到 62.4%。
值得关注
- 技术路线融合:RPent 结合了纯VLA端到端的高精度操作与大模型Agent的强泛化规划能力,通过“观察-规划-执行-反馈-再规划”闭环,解决了单一路线在长程任务或场景扰动下的退化问题。
- 真机演示效果:视频展示中,机器人能够处理非结构化任务,如将钢珠倒入碗、双臂协同擦拭盘子、主动移开遮挡物寻找勺子等,体现了从“会动”到“会做事”的能力跃迁。
- 开源生态:代码已开源至 GitHub (https://github.com/RLinf/RPent),并提供 Leaderboard 板块对比不同基座模型与技术路线的性能与延时,鼓励社区共同推进具身智能基础设施的发展。
