无问芯穹联合清华、上交开源APXInf:Pi 0.5在Jetson Thor上延迟降至26ms
2026/09/15 18:43阅读量 4
无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎APXInf,旨在解决机器人本体部署中算力受限与实时性要求高的痛点。该引擎通过端到端优化,使PI 0.5模型在Jetson Thor上的FP8推理延迟从278ms大幅降低至26ms以内,频率达38.46Hz,达到SOTA水平。APXInf采用Rust构建核心运行时以保障稳定性,并兼容Agentic Engineering流程,作为RLinf训练框架的配套推理组件,打通了从云端训练到端侧部署的全链路。
事件概述
具身智能从Demo走向规模化落地的核心瓶颈在于机器人本体的实时推理能力。针对端侧算力有限、功耗敏感及低延迟需求,无问芯穹(Infinigence)联合清华大学、上海交通大学正式开源了具身智能端侧推理引擎——APXInf。该引擎支持RTX 4090、Jetson Orin、Jetson Thor等主流硬件,填补了从模型训练到本体部署的关键环节。
核心性能表现
APXInf通过Pipeline、Graph、Kernel及量化等多层优化,实现了极致的端侧推理性能:
- 延迟突破:在NVIDIA Jetson Thor平台上,PI 0.5 (FP8)模型的端到端推理延迟从278ms降低至26ms以内,实现10.7倍的延迟下降。
- 高频响应:在FP8精度下,推理频率达到38.46Hz,完全满足机器人多场景下实时控制对高帧率和低响应的严苛要求。
- SOTA地位:上述性能指标在当前具身端侧推理领域处于State-of-the-Art (SOTA) 水平。
技术架构与设计理念
APXInf的设计兼顾了高性能、高稳定性与工程敏捷性:
- 极致性能(Fast):围绕机器人真实执行链路进行端到端优化,利用Agent4Kernel技术融合极限优化的算子,挖掘硬件性能上限。
- 系统稳定(Stable):
- 采用Rust语言构建极简运行时,利用其内存安全特性从源头规避内存风险,提升长期运行的可预测性和稳定性。
- 提供Python接口封装,保留开发者熟悉的调用方式,降低使用门槛。
- 敏捷适配(Agile):
- 面向Agentic Engineering研发流程设计,通过功能隔离和工具箱模型方法,显著降低新模型接入与迭代成本。
- 旨在让推理引擎成为连接模型、硬件、机器人与开发者的基础设施,而非被动的Runtime。
生态整合与路线图
- 前后端协同:APXInf是无问芯穹此前开源的强化学习训练框架RLinf的端侧推理组件。两者结合,形成了从“云端模型训练/评测”到“本体推理/部署”的完整具身智能技术生态闭环。
- 首发支持:当前版本首发支持PI 0.5和WALL-OSS两款具身模型。
- 未来规划:
- 适配更多VLA、VLM及世界模型(如Qwen、Groot)。
- 推进nvfp4极致性能优化。
- 拓展国产化芯片后端及国产机器人操作系统支持。
- 适配AMD等行业主流芯片。
