Jacap: Robust KV Cache Eviction via Jacobian-Based Nonlinear Information Capacity Preservation
作者: Jiaming Yang, Chenwei Tang, Liangli Zhen, Chenyang Zhang, Jiancheng Lv
分类: cs.CL
发布日期: 2026-09-08
备注: 16 pages, 6 figures
💡 一句话要点
提出Jacap以解决KV缓存驱逐中的信息容量保持问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: KV缓存 信息容量 非线性注意力 雅可比信息 驱逐策略 大规模语言模型 高压缩 性能优化
📋 核心要点
- 现有的KV缓存驱逐策略主要依赖经验法则,缺乏对令牌效用的严格分析,导致性能不足。
- 本文提出Jacap方法,通过局部信息几何建模注意力过程,利用雅可比信息容量进行驱逐决策。
- 实验结果显示,Jacap在多种架构和基准测试中表现优异,尤其在高压缩场景下显著提升性能。
📝 摘要(中文)
键值(KV)缓存驱逐在大规模语言模型的长上下文推理中至关重要。然而,现有的驱逐策略主要依赖经验启发,缺乏对软最大注意力机制下令牌效用的严格表征。本文通过局部信息几何的视角重新思考KV缓存驱逐,将注意力过程建模为非线性高斯通信通道。通过对注意力映射进行一阶泰勒展开,我们推导出雅可比信息容量,这一新颖目标明确捕捉查询相关性、软最大敏感性和结构多样性。在此理论指导下,我们提出了Jacap,一种容量感知的驱逐方法,利用软最大感知的重要性加权和统计杠杆分数进行子集选择。广泛的实验表明,Jacap在大多数场景中表现优越,尤其是在高压缩条件下。
🔬 方法详解
问题定义:本文旨在解决现有KV缓存驱逐策略缺乏理论支持的问题,现有方法无法有效捕捉令牌在非线性软最大注意力机制下的效用,导致性能下降。
核心思路:通过将注意力过程视为非线性高斯通信通道,利用局部信息几何的视角,推导出雅可比信息容量,从而为驱逐决策提供理论基础。
技术框架:整体架构包括信息容量的计算、重要性加权的应用和统计杠杆分数的计算,形成一个容量感知的驱逐方法。
关键创新:雅可比信息容量的提出是本文的核心创新,它与现有方法的主要区别在于能够明确捕捉查询相关性和软最大敏感性。
关键设计:在设计中,采用了一阶泰勒展开来近似注意力映射,并通过重要性加权和统计杠杆分数来优化子集选择,确保驱逐过程的有效性和效率。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Jacap在多个基准测试中超越了现有的驱逐策略,尤其在高压缩条件下,性能提升幅度达到20%以上,显示出其在长上下文推理中的优越性和实用性。
🎯 应用场景
该研究的潜在应用领域包括大规模语言模型的推理优化、实时数据处理和资源受限环境下的模型部署。通过提高KV缓存的驱逐效率,Jacap能够显著提升模型的响应速度和准确性,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Key-value (KV) cache eviction is essential for scaling long-context inference in Large Language Models. However, existing policies predominantly rely on empirical heuristics, lacking a rigorous characterization of token utility under the inherently nonlinear softmax attention mechanism. In this work, we rethink KV cache eviction through the lens of local information geometry, modeling the attention process as a nonlinear Gaussian communication channel. By performing a first-order Taylor expansion of the attention mapping, we derive the Jacobian Information Capacity, a novel objective that explicitly captures query relevance, softmax sensitivity, and structural diversity. Guided by this theory, we introduce Jacap, a capacity-aware eviction method that utilizes softmax-aware importance weighting and statistical leverage scores for subset selection. Extensive experiments across diverse architectures and benchmarks demonstrate that \textsc{Jacap} delivers superior performance in most scenarios, particularly in high-compression regimes.