Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
作者: Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki
分类: cs.RO, cs.CV, cs.LG
发布日期: 2026-07-07
💡 一句话要点
提出ActionCache以解决VLA模型实时推理延迟问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 实时推理 动作缓存 多模态学习 机器人操作
📋 核心要点
- 现有的VLA模型在实时部署中面临着迭代去噪过程带来的计算瓶颈,影响了效率。
- 本文提出的ActionCache通过重用历史中间动作来加速生成过程,从而降低推理延迟。
- 实验结果显示,ActionCache在模拟和现实环境中均能保持高任务成功率,并显著提升推理速度。
📝 摘要(中文)
视觉-语言-动作(VLA)模型作为一种有前景的通用机器人操作方法,因其生成精确平滑的动作序列和捕捉多模态分布的能力而受到关注。然而,动作头中的迭代去噪过程成为了主要的计算瓶颈,影响了实时部署。为此,本文提出了ActionCache,一个可插拔的外部缓存,通过重用过去的中间动作来加速生成,从而显著降低推理延迟。ActionCache使用紧凑的多模态键存储中间动作,能够在不同任务或情境中检索相似的过去上下文。实验结果表明,ActionCache在低延迟下保持高任务成功率,对于代表性的基于流的VLA模型,推理加速分别达到11.75倍和34.43倍。
🔬 方法详解
问题定义:本文旨在解决视觉-语言-动作(VLA)模型在实时应用中因迭代去噪过程导致的高计算延迟问题。现有方法在生成动作序列时效率低下,限制了其在实际场景中的应用。
核心思路:论文提出的ActionCache通过存储和重用过去的中间动作,利用紧凑的多模态键来快速检索相似上下文,从而实现生成过程的加速。这种设计能够有效减少推理时间,提高实时性。
技术框架:整体架构包括ActionCache模块,该模块与现有的VLA模型相结合,形成一个可插拔的系统。在推理过程中,模型首先查询ActionCache以获取相关的中间动作,然后基于这些动作进行快速生成。
关键创新:ActionCache的核心创新在于其能够在不同任务或情境中重用历史信息,显著降低了推理延迟。这一方法与传统的逐步生成方式形成鲜明对比,后者无法有效利用过去的经验。
关键设计:在设计中,ActionCache使用紧凑的多模态键来存储中间动作,确保高效检索。此外,模型的损失函数和网络结构经过优化,以适应快速生成的需求。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用ActionCache后,代表性的流基VLA模型在推理速度上分别实现了11.75倍和34.43倍的加速,且在低延迟条件下仍能保持高任务成功率。这一显著提升表明了该方法在实际应用中的有效性。
🎯 应用场景
该研究的潜在应用领域包括智能机器人、自动化制造和人机交互等场景。通过提升VLA模型的实时推理能力,ActionCache能够在复杂环境中实现更高效的机器人操作,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Vision-Language-Action (VLA) models have emerged as a promising approach for generalizable robotic manipulations. In particular, flow matching-based VLA models have shown remarkable success due to their capability to generate precise and smooth action sequences and capture multimodal distributions. However, the iterative denoising process in the action head acts as a major computational bottleneck, posing a critical challenge for real-time deployment. To address this challenge, we propose ActionCache, a plug-and-play external cache that opportunistically reuses past intermediate actions to warm-start generations from the vicinity of target actions, thereby drastically reducing the inference latency. Specifically, ActionCache stores the intermediate actions with compact multimodal keys, which enables retrieval from similar past contexts across different episodes or even different tasks. Experimental results in simulation and real-world environments demonstrate that ActionCache maintains high task success rates in a low-latency regime, achieving inference acceleration of up to $11.75\times$ and $34.43\times$ for representative flow-based VLA models, $π_{0.5}$ and GR00T-N1.6, respectively.