OmniKVQuant: KV Cache Quantization for Omni-LLMs

📄 arXiv: 2609.11582v1 📥 PDF

作者: Suho Yoo, Hyunjong Ok, Jongmin Choi, Jihoo Jung, Joon Son Chung

分类: cs.CV

发布日期: 2026-09-10

备注: Preprint

🔗 代码/项目: GITHUB


💡 一句话要点

提出OmniKVQuant以解决Omni-LLMs的KV缓存量化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 全模态语言模型 KV缓存量化 多模态处理 无训练框架 性能优化

📋 核心要点

  1. 现有的KV缓存量化方法在处理多模态数据时面临时间键漂移和异构值几何等挑战,影响性能。
  2. OmniKVQuant通过在输入流的短窗口内设置键量化范围,并对不同模态的值进行单独旋转,提出了一种新的解决方案。
  3. 在Qwen2.5-Omni和Qwen3-Omni的实验中,OmniKVQuant实现了2位KV缓存,并在多个基准测试中保持了高性能。

📝 摘要(中文)

随着全模态大型语言模型(Omni-LLMs)同时处理音频、视频和文本,其键值(KV)缓存的内存成本不断增加。虽然KV缓存量化在文本专用的LLMs中已成为常用方法,但在Omni-LLMs中的应用尚未被探索。本文分析了代表性的基于旋转的KV缓存量化方法TurboQuant在多模态缓存中的表现,并识别出两个关键问题:时间键漂移和异构值几何。为此,我们提出了OmniKVQuant,一个无训练框架,能够在输入流的每个短窗口上设置键量化范围,并对每种模态单独旋转值。在Qwen2.5-Omni和Qwen3-Omni上,OmniKVQuant实现了2位KV缓存,同时在七个音视频基准测试中显著保持了性能。我们还提供了一个融合的Triton解码内核,在注意力机制中解包2位缓存,从而避免构建密集的FP16缓存。

🔬 方法详解

问题定义:本文旨在解决Omni-LLMs在多模态数据处理中的KV缓存量化问题。现有方法如TurboQuant在多模态缓存中表现不佳,主要受到时间键漂移和异构值几何的影响。

核心思路:OmniKVQuant的核心思路是通过无训练的方式,针对每个输入流的短窗口设置键量化范围,并对不同模态的值进行独立旋转,以解决现有方法的不足。

技术框架:OmniKVQuant的整体架构包括两个主要模块:一是短窗口内的键量化范围设置,二是模态独立的值旋转。这种设计使得在处理多模态数据时,能够有效减少内存占用并保持性能。

关键创新:OmniKVQuant的关键创新在于其无训练的框架设计,能够灵活应对多模态数据的特性,避免了传统方法中因训练而导致的复杂性和性能损失。

关键设计:在参数设置上,OmniKVQuant为每个模态的值旋转设计了独立的策略,并在短窗口内动态调整键量化范围,确保在不同模态下的性能一致性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在Qwen2.5-Omni和Qwen3-Omni的实验中,OmniKVQuant成功实现了2位KV缓存,相较于传统方法在七个音视频基准测试中显著保持了性能,展示了其在多模态处理中的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括多模态智能助手、视频分析、音频处理等。通过优化KV缓存的量化,OmniKVQuant能够在资源受限的环境中有效提升Omni-LLMs的性能,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

As Omni-modal large language models (Omni-LLMs) take in audio, video and text together, their KV cache memory cost grows. KV cache quantization is the de facto approach in text-only LLMs, but its application to Omni-LLMs remains unexplored. In this paper, we analyze how TurboQuant, a representative rotation-based KV cache quantization method, behaves on multimodal caches and identify two critical issues: temporal key drift and heterogeneous value geometry. To address these, we propose OmniKVQuant, a training-free framework that (i) sets the key quantization range over each short window of the input stream; and (ii) rotates values separately per modality. On Qwen2.5-Omni and Qwen3-Omni, OmniKVQuant enables 2-bit KV caches while substantially preserving performance across seven audio-visual benchmarks. We further provide a fused Triton decode kernel that unpacks the 2-bit cache during attention, so no dense FP16 cache is ever built. Code: https://github.com/kaistmm/OmniKVQuant