无问芯穹联合清华、上交开源APXInf:Pi 0.5在Jetson Thor上延迟降至26ms

2026/09/15 18:43阅读量 4

无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎APXInf,旨在解决机器人本体部署中算力受限与实时性要求高的痛点。该引擎通过端到端优化,使PI 0.5模型在Jetson Thor上的FP8推理延迟从278ms大幅降低至26ms以内,频率达38.46Hz,达到SOTA水平。APXInf采用Rust构建核心运行时以保障稳定性,并兼容Agentic Engineering流程,作为RLinf训练框架的配套推理组件,打通了从云端训练到端侧部署的全链路。

事件概述

具身智能从Demo走向规模化落地的核心瓶颈在于机器人本体的实时推理能力。针对端侧算力有限、功耗敏感及低延迟需求,无问芯穹(Infinigence)联合清华大学上海交通大学正式开源了具身智能端侧推理引擎——APXInf。该引擎支持RTX 4090、Jetson Orin、Jetson Thor等主流硬件,填补了从模型训练到本体部署的关键环节。

核心性能表现

APXInf通过Pipeline、Graph、Kernel及量化等多层优化,实现了极致的端侧推理性能:

  • 延迟突破:在NVIDIA Jetson Thor平台上,PI 0.5 (FP8)模型的端到端推理延迟从278ms降低至26ms以内,实现10.7倍的延迟下降。
  • 高频响应:在FP8精度下,推理频率达到38.46Hz,完全满足机器人多场景下实时控制对高帧率和低响应的严苛要求。
  • SOTA地位:上述性能指标在当前具身端侧推理领域处于State-of-the-Art (SOTA) 水平。

技术架构与设计理念

APXInf的设计兼顾了高性能、高稳定性与工程敏捷性:

  1. 极致性能(Fast):围绕机器人真实执行链路进行端到端优化,利用Agent4Kernel技术融合极限优化的算子,挖掘硬件性能上限。
  2. 系统稳定(Stable)
    • 采用Rust语言构建极简运行时,利用其内存安全特性从源头规避内存风险,提升长期运行的可预测性和稳定性。
    • 提供Python接口封装,保留开发者熟悉的调用方式,降低使用门槛。
  3. 敏捷适配(Agile)
    • 面向Agentic Engineering研发流程设计,通过功能隔离和工具箱模型方法,显著降低新模型接入与迭代成本。
    • 旨在让推理引擎成为连接模型、硬件、机器人与开发者的基础设施,而非被动的Runtime。

生态整合与路线图

  • 前后端协同:APXInf是无问芯穹此前开源的强化学习训练框架RLinf的端侧推理组件。两者结合,形成了从“云端模型训练/评测”到“本体推理/部署”的完整具身智能技术生态闭环。
  • 首发支持:当前版本首发支持PI 0.5WALL-OSS两款具身模型。
  • 未来规划
    • 适配更多VLA、VLM及世界模型(如Qwen、Groot)。
    • 推进nvfp4极致性能优化。
    • 拓展国产化芯片后端及国产机器人操作系统支持。
    • 适配AMD等行业主流芯片。

开源信息

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。