A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

📄 arXiv: 2607.24148v1 📥 PDF

作者: Zhuoran Song, Haozhe Jiang, Chunyu Qi, Minnan Pei, Gang Li, Xiaoyao Liang, Haibing Guan

分类: cs.AI

发布日期: 2026-07-27


💡 一句话要点

提出VQVLA框架以解决VLA模型推理延迟问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 向量量化 动态精度 GEMM加速 算法-硬件协同设计

📋 核心要点

  1. 现有VLA模型在GPU上的推理延迟较高,限制了其在实时应用中的部署。
  2. 提出VQVLA框架,通过运动感知向量量化和合并质心的GEMM范式来优化推理效率。
  3. 实验结果显示,VQVLA在多个基线模型上实现了显著的加速,且保持了较高的准确性。

📝 摘要(中文)

视觉-语言-动作(VLA)模型在具身人工智能中展现出强大的潜力,但其在GPU上的高推理延迟限制了实时部署。现有加速器如Dadu-Corki虽然提高了效率,但仍将VLA模型视为全精度工作负载,导致内存和计算的冗余未被充分利用。本文提出了VQVLA,一个算法-硬件协同设计框架,通过利用权重相似性和执行动态来加速VLA推理。我们首先引入了MotionVQ,一种基于运动的向量量化方案,动态调整量化精度,从而减少内存访问并保持任务成功率。接着,我们提出了一种合并质心的向量化GEMM范式,通过空间聚合和质心的时间重用来消除冗余乘法。实验结果表明,VQVLA在A100 GPU、Dadu-Corki、LUT-DLA、CodeGEMM和ShiftAddLLM上分别实现了6.5倍、2.8倍、1.9倍、3.3倍和4.3倍的加速,且准确率几乎没有下降。

🔬 方法详解

问题定义:本文旨在解决视觉-语言-动作(VLA)模型在GPU推理时的高延迟问题。现有方法如Dadu-Corki未能充分利用内存和计算资源,导致效率低下。

核心思路:VQVLA框架通过引入运动感知向量量化(MotionVQ)和合并质心的向量化GEMM,动态调整量化精度和重用计算,来提升推理速度。

技术框架:VQVLA框架包括两个主要模块:MotionVQ用于动态量化,合并质心的GEMM用于高效计算。整体流程为:首先根据机器人的执行状态调整量化精度,然后利用合并质心的方式进行高效的矩阵乘法计算。

关键创新:最重要的创新在于MotionVQ的动态量化策略和合并质心的GEMM范式,这两者有效减少了冗余计算和内存访问,与传统全精度方法相比,显著提升了推理效率。

关键设计:在设计中,MotionVQ根据机器人的运动状态动态调整量化精度,合并质心的GEMM通过空间聚合和时间重用来消除冗余乘法,确保了高效的计算性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,VQVLA在多个基线模型上实现了显著的加速,具体为在A100 GPU上实现6.5倍加速,相较于Dadu-Corki、LUT-DLA、CodeGEMM和ShiftAddLLM分别实现2.8倍、1.9倍、3.3倍和4.3倍的提升,且准确率几乎没有下降。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、智能家居等具身人工智能场景。通过提高VLA模型的推理效率,VQVLA框架能够支持实时决策和交互,推动智能系统的普及与发展。

📄 摘要(原文)

Vision-Language-Action (VLA) models have demonstrated strong potential for embodied AI, yet their high inference latency on GPUs limits real-time deployment. Existing accelerators, such as Dadu-Corki, improve efficiency but treat VLA models as full-precision workloads, leaving substantial redundancy in both memory and computation underexploited. In this paper, we propose VQVLA, an algorithm-hardware co-design framework that accelerates VLA inference by exploiting weight similarity and execution dynamics. We first introduce MotionVQ, a motion-aware vector quantization scheme that dynamically adjusts quantization precision based on the robot's execution state, reducing memory access while preserving task success rate. We then propose a merged-centroid vectorized GEMM paradigm that operates on the codebook-index representation, eliminating redundant multiplications through spatial aggregation and temporal reuse of centroids. To realize these optimizations, we design an accelerator that efficiently supports dynamic precision selection and centroid-reuse computation. Experimental results show that VQVLA achieves 6.5x, 2.8x, 1.9x, 3.3x, and 4.3x speedup over the A100 GPU, Dadu-Corki, LUT-DLA, CodeGEMM, and ShiftAddLLM, respectively, with negligible accuracy degradation.