实现10.7倍延迟下降。
作者 |
刘俐杉
编辑 |
许丽思
机器人前瞻9月15日报道,今天,无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf。
如今的具身模型已经能够看懂环境、理解指令,并把看到的、听到的信息转化为机器人该怎么做的决策。
但当一个在云端运行良好的具身模型,放到机器人本体上,让它落地干活时,“模型够不够聪明”已经不是首先要面对的问题,推理系统才是让具身智能规模化落地的关键。
此次开源的具身端侧推理引擎APXInf,不仅能够让具身模型在真实机器人上能够“跑起来”,更希望可以
在有限资源下“跑得够快、够稳,也足够容易接入拓展和持续迭代”。
APXInf支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台,覆盖从模型开发、效果验证到机器人本体部署的完整链路。
同时在Jetson Thor上,该推理引擎让PI 0.5 FP8实现端到端推理延迟
从278ms降低至26ms
以内;在 FP8下达到
46Hz推理频率
,满足机器人多场景下实时控制对推理频率和响应延迟的要求。
开源地址:
GitHub:https://github.com/RLinf/APXinf-robo
01
.
推理延迟从278ms降至26ms以内
APXInf的第一个核心能力是,
围绕机器人真实执行链路进行端到端优化
,让机器人从“看到”到“动起来”的整条执行链路变快。
APXInf通过
Pipeline、Graph、Kernel及量化
等多层优化,降低具身模型端到端推理延迟。
同时,通过冗余特性的系统设计,为模型提供定制化运行时,在更加轻量化的同时将性能挖掘到极致,并借助Agent4Kernel技术进行极限优化的融合算子,最终达到性能SOTA。
▲PI 0.5在Jetson AGX Thor 上进入实时推理区间
在 Thor 上,APXInf将PI 0.5 FP8的端到端推理延迟
从278ms降至26ms以内
,频率可达
38.46Hz,
为机器人实时感知与控制提供更充足的响应空间。
10.7倍的推理延迟下降,对机器人而言,意味着更快的“感知-决策-动作”闭环,也意味着
具身模型有机会在真实机器人上进入更加实时的工作状态。
02
.
让推理行为在真实部署中可预测、不中断
第二个核心能力,“更稳”。在机器人端侧推理中,并不是“一次跑通”就结束了。
APXInf强调在长时间运行、感知、推理、控制等多个模块同时运行的真实部署环境中,行为可预测,能够持续稳定运行的能力。
那么它是如何做到的?
▲创新架构
研究团队采用了创新架构,使用Rust系统语言构建的极简运行时,和Python易用接口。
首先,APXInf利用冗余特性设计,打造极简化运行时,降低运行开销的同时做到可核查、可验证。
其次,利用Rust语言提供的内存安全特性,进一步提升引擎稳定性、降低易错面,从源头规避内存风险,减少运行中崩溃、异常的概率。
最后,通过Python接口封装,保留开发者熟悉的调用方式,兼顾底层硬核与上层易用。
03
.
利用Agentic Engineering
降低接入与优化成本
解决了“跑得够不够快”和“能否稳定运行”的问题后,APXInf面临的第三个问题是,面对越来越多的具身模型和具身系统,模型怎么更快、更敏捷地接入,并且持续优化?
伴随着大模型能力的提升,推理引擎利用Agentic Engineering,可以快速实现新模型的适配与接入。
关键是,这一能力可以加速APXInf的研发迭代,还会开放给APXInf的开发者,让用户自研模型的接入与优化变得简单和敏捷。
所以,从设计之初,APXInf就是面向
Agentic Engineering研发流程
来设计的。
通过
冗余特性、功能隔离、工具箱模型
等方法,显著提升APXInf与Agentic Engineering的适配度,降低研发门槛,使得Token可以更便利高效地转化为生产力。
无问芯穹称,
APXInf也将面向Agentic Native进行探索和迭代,
并探索一种全新的面向Agentic Engineering时代的推理系统构建范式。
04
.
结语:补上具身智能规模化落地的关键一环
APXInf这次开源,首发支持PI 0.5、WALL-OSS,覆盖Jetson Orin、Jetson Thor和RTX 4090,并给出从VLA、VLM、世界模型到国产芯片、国产机器人操作系统、AMD等方向的Roadmap。
同时,APXInf作为
RLinf开源生态中的端侧推理项目首发,
把模型训练、效果验证,到本体部署与真实机器人运行连成一条完整链路,补上了具身智能规模化落地的关键一环
。
但具体能否规模化落地,还需要看到真正的实践:在不同机器人本体上能否长期稳定地“跑”,在真实场景中能否扛住延迟、轨迹抖动、算力和内存的消耗。这些问题答案都只能在物理世界中才可得到。