Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference
作者: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li
分类: cs.RO, cs.AI
发布日期: 2026-07-20
💡 一句话要点
提出Jetson-PI以解决低功耗设备上VLA模型的实时控制问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 低功耗设备 异步推理 实时控制 机器人技术 CUDA加速 未来校正
📋 核心要点
- 现有VLA模型在低功耗设备上部署时面临高计算复杂度,导致推理延迟和控制频率低的问题。
- 提出Jetson-PI,通过前瞻性对齐异步校正,训练轻量级未来校正模块,优化异步推理过程。
- 实验结果显示,Jetson-PI在控制频率上提升8.66倍,并在LIBERO基准上成功率提升14.8%。
📝 摘要(中文)
视觉-语言-动作(VLA)模型在多种具身任务上表现出色,但在低功耗设备(如Jetson Orin)上部署时,由于计算复杂度高,导致推理延迟和控制频率低。异步推理虽然可以部分掩盖延迟,但引入了感知与执行不一致和反应时间长的问题。本文提出Jetson-PI,通过前瞻性对齐异步校正方法,实现高效的VLA模型部署。我们训练了轻量级的未来校正模块,预测基于已承诺动作的未来环境表示,使动作专家能够直接从未来时间步预测动作。此外,我们引入基于置信度的调度优化,动态平衡VLM和动作专家的调用,并结合系统级加速技术。实验表明,Jetson-PI在NVIDIA Jetson Orin上相比于原始PyTorch实现控制频率提升8.66倍,成功率提升14.8%。
🔬 方法详解
问题定义:本文主要解决在低功耗设备上部署视觉-语言-动作(VLA)模型时,由于计算复杂度高导致的推理延迟和控制频率低的问题。现有的异步推理方法虽然可以部分掩盖延迟,但会引发感知与执行不一致和反应时间长的挑战。
核心思路:Jetson-PI的核心思路是通过前瞻性对齐异步校正,训练一个轻量级的未来校正模块,能够基于已承诺的动作预测未来环境表示,从而使动作专家能够更准确地从未来时间步预测动作。这种设计旨在减少感知与执行之间的误差,提高反应速度。
技术框架:Jetson-PI的整体架构包括未来校正模块、动作专家和基于置信度的调度优化。未来校正模块负责预测未来环境,动作专家则基于这些预测生成动作,而调度优化则动态平衡两者的调用频率。此外,系统级加速技术如CUDA图重用、GPU驻留中间缓冲和流展开也被应用于提升整体性能。
关键创新:本文的关键创新在于提出了前瞻性对齐异步校正方法和轻量级未来校正模块,这与现有方法的主要区别在于能够有效减少感知与执行之间的误差,并加快反应时间。
关键设计:在设计上,未来校正模块采用了轻量级网络结构,损失函数则结合了预测精度和执行一致性。同时,调度优化算法根据置信度动态调整VLM和动作专家的调用频率,以实现更高效的资源利用。实验中还使用了CUDA图重用等技术来进一步提升性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Jetson-PI在NVIDIA Jetson Orin上相比于原始PyTorch实现,控制频率提升了8.66倍,成功率在LIBERO基准上提升了14.8%。这些显著的性能提升展示了该方法在实际应用中的有效性和优势。
🎯 应用场景
Jetson-PI的研究成果在机器人控制、自动驾驶、智能家居等领域具有广泛的应用潜力。通过在低功耗设备上实现高效的VLA模型部署,可以推动这些领域的智能化进程,提高系统的实时反应能力和决策效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Vision-Language-Action (VLA) models have achieved impressive performance on diverse embodied tasks. However, deploying VLA models on low-power onboard devices, such as the Jetson Orin, remains challenging due to their high computational complexity, which leads to substantial inference latency and low control frequency. Asynchronous inference can partially mask this latency by parallelizing action execution and subsequent inference, but it introduces two critical issues: perception-execution misalignment and long reaction time. In this paper, we propose Jetson-PI, a method for efficient VLA deployment on onboard devices via Foresight-Aligned Asynchronous Correction. To address misalignment, we train a lightweight future correction module that predicts future environment representation conditioned on committed actions, enabling the action expert to directly predict actions from the future time step. To reduce reaction time, we introduce confidence-based scheduling optimization that adaptively balances VLM and action expert invocations, complemented by system-level accelerations including CUDA graph reuse, GPU-resident intermediate buffering, and flow unrolling. Extensive experiments demonstrate that Jetson-PI achieves 8.66x and 5.41x improvements in control frequency compared with naive PyTorch andthis http URLon NVIDIA Jetson Orin, while outperforming VLASH by 14.8\% in average success rate on the LIBERO benchmark. The code of our asynchronous algorithm is available onthis https URL, and our efficientthis http URL-based inference engine is available onthis https URL.