Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

📄 arXiv: 2607.12659v1 📥 PDF

作者: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

分类: cs.RO, cs.AI

发布日期: 2026-07-14

备注: 16 pages, 10 figures

🔗 代码/项目: GITHUB | GITHUB


💡 一句话要点

提出Jetson-PI以解决低功耗设备上VLA模型实时控制问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 低功耗设备 异步推理 实时控制 机器人技术 CUDA加速 未来校正 调度优化

📋 核心要点

  1. 现有VLA模型在低功耗设备上部署时,由于计算复杂度高,导致推理延迟和控制频率低,影响实时性。
  2. 本文提出Jetson-PI,通过前瞻对齐异步校正方法,训练轻量级未来校正模块,减少感知与执行的错位。
  3. 实验表明,Jetson-PI在控制频率上相比于传统方法有显著提升,并在LIBERO基准测试中表现优异。

📝 摘要(中文)

视觉-语言-动作(VLA)模型在多种具身任务上表现出色,但在低功耗设备(如Jetson Orin)上部署时面临高计算复杂度带来的推理延迟和控制频率低的问题。为此,本文提出Jetson-PI,通过前瞻对齐异步校正方法实现高效的VLA部署。我们训练了一个轻量级的未来校正模块,能够根据已承诺的动作预测未来环境表示,从而使动作专家能够直接从未来时间步预测动作。此外,引入基于置信度的调度优化,动态平衡VLM和动作专家的调用,并通过CUDA图重用、GPU驻留中间缓冲和流展开等系统级加速手段来减少反应时间。实验结果表明,Jetson-PI在NVIDIA Jetson Orin上相比于原始PyTorch和vla.cpp分别提升了8.66倍和5.41倍的控制频率,并在LIBERO基准测试中比VLASH的平均成功率提高了14.8%。

🔬 方法详解

问题定义:本文旨在解决在低功耗设备上部署视觉-语言-动作(VLA)模型时,由于高计算复杂度导致的推理延迟和控制频率低的问题。现有的异步推理方法虽然可以部分掩盖延迟,但引入了感知与执行的错位和反应时间长等问题。

核心思路:Jetson-PI的核心思路是通过前瞻对齐异步校正,训练一个轻量级的未来校正模块,能够根据已承诺的动作预测未来的环境表示,从而使动作专家能够直接从未来时间步预测动作。这种设计旨在减少感知与执行之间的错位,提高反应速度。

技术框架:Jetson-PI的整体架构包括未来校正模块和基于置信度的调度优化。未来校正模块负责预测未来环境,而调度优化则动态平衡视觉-语言模型(VLM)和动作专家的调用。此外,系统级加速手段如CUDA图重用和GPU驻留中间缓冲也被集成进来。

关键创新:最重要的技术创新点在于引入了未来校正模块,使得动作预测能够基于未来环境进行,从而有效减少了感知与执行的错位。这与现有方法的本质区别在于,现有方法通常依赖于当前状态进行预测,容易导致延迟。

关键设计:在设计中,未来校正模块采用轻量级网络结构,确保在低功耗设备上高效运行。同时,调度优化采用置信度评估机制,动态调整VLM和动作专家的调用频率,以适应不同的环境变化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Jetson-PI在NVIDIA Jetson Orin上实现了8.66倍和5.41倍的控制频率提升,相比于原始PyTorch和vla.cpp。同时,在LIBERO基准测试中,Jetson-PI的平均成功率比VLASH提高了14.8%,展示了其在实际应用中的优越性能。

🎯 应用场景

Jetson-PI的研究成果具有广泛的应用潜力,尤其是在需要实时决策和控制的机器人领域,如自动驾驶、无人机控制和智能家居等。通过提高低功耗设备上的VLA模型的实时性,该技术能够推动更多智能设备的普及与应用,提升人机交互的效率和体验。

📄 摘要(原文)

Vision-Language-Action (VLA) models have achieved impressive performance on diverse embodied tasks. However, deploying VLA models on low-power onboard devices, such as the Jetson Orin, remains challenging due to their high computational complexity, which leads to substantial inference latency and low control frequency. Asynchronous inference can partially mask this latency by parallelizing action execution and subsequent inference, but it introduces two critical issues: perception-execution misalignment and long reaction time. In this paper, we propose Jetson-PI, a method for efficient VLA deployment on onboard devices via Foresight-Aligned Asynchronous Correction. To address misalignment, we train a lightweight future correction module that predicts future environment representation conditioned on committed actions, enabling the action expert to directly predict actions from the future time step. To reduce reaction time, we introduce confidence-based scheduling optimization that adaptively balances VLM and action expert invocations, complemented by system-level accelerations including CUDA graph reuse, GPU-resident intermediate buffering, and flow unrolling. Extensive experiments demonstrate that Jetson-PI achieves 8.66x and 5.41x improvements in control frequency compared with naive PyTorch and vla.cpp on NVIDIA Jetson Orin, while outperforming VLASH by 14.8\% in average success rate on the LIBERO benchmark. The code of our asynchronous algorithm is available on https://github.com/PKU-SEC-Lab/Jetson-PI, and our efficient llama.cpp-based inference engine is available on https://github.com/PKU-SEC-Lab/Jetson-PI-Edge.