LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding

📄 arXiv: 2607.24555v1 📥 PDF

作者: Junsung Hwang

分类: cs.LG, cs.AI

发布日期: 2026-07-27


💡 一句话要点

提出LOCKS以解决长上下文解码中的KV缓存瓶颈问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长上下文解码 关键值缓存 谱总结 注意力机制 自然语言处理 解码效率 长文本处理

📋 核心要点

  1. 现有方法在长上下文解码中,KV缓存的读取效率低,导致性能瓶颈。
  2. LOCKS通过为每个页面提供独特的谱总结,重构logits并选择最重要的页面,优化了解码过程。
  3. 在长文档问答和长形式推理任务中,LOCKS显著提高了性能,减少了解码延迟,达到更高的效率。

📝 摘要(中文)

在长上下文下服务大型语言模型时,关键值(KV)缓存的读取效率成为瓶颈。LOCKS为每个页面提供独特的谱总结,重构页面内的logits,并通过log-sum-exp估计每个页面的注意力质量,仅关注最重要的页面。该方法在长文档问答任务中表现出色,与完整缓存的性能相近,同时显著降低了解码延迟,展现出在长形式推理任务中的优势。

🔬 方法详解

问题定义:论文旨在解决在长上下文解码中,KV缓存的读取效率低下问题。现有方法在每一步解码时需完整读取KV缓存,导致性能瓶颈。

核心思路:LOCKS的核心思路是为每个页面提供独特的谱总结,利用局部低秩特性重构页面内的logits,并通过log-sum-exp方法估计注意力质量,仅关注最重要的页面,从而提高解码效率。

技术框架:LOCKS的整体架构包括三个主要模块:页面特定的谱总结生成、logits重构和注意力选择。首先,为每个页面生成小型的谱总结;然后重构页面内的logits;最后根据注意力质量选择最重要的页面进行解码。

关键创新:LOCKS的最大创新在于为每个页面提供独特的谱总结,避免了共享低秩基的局限性。这一设计使得选择过程不再需要读取所有候选的KV对,从而显著提高了效率。

关键设计:LOCKS在参数设置上采用了小型的谱总结,约为完整缓存大小的十分之一,并通过log-sum-exp方法进行注意力质量估计。该方法在解码过程中仅关注最重要的页面,确保了高效性与准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在长文档问答任务中,LOCKS在保持与完整KV缓存相近的性能的同时,仅关注约2%的令牌,显著降低了解码延迟。在1M令牌的情况下,解码延迟减少了2倍,展现出在长形式推理任务中的明显优势。

🎯 应用场景

LOCKS的研究成果在长文本处理、问答系统和长形式推理等领域具有广泛的应用潜力。通过提高解码效率,该方法能够在资源受限的环境中更好地服务大型语言模型,推动自然语言处理技术的发展。未来,LOCKS可能会被集成到更多的语言模型和应用中,以提升其性能和响应速度。

📄 摘要(原文)

Serving large language models at long context is bottlenecked by the key-value (KV) cache, which is read in full at every decode step. Attention keys are locally low-rank though globally high-rank: shared low-rank bases discard page-specific directions that a page's own compact basis retains. LOCKS gives every page its own spectral summary (resident, about a tenth the cache's size), reconstructs within-page logits, estimates each page's attention mass by log-sum-exp, and attends only the top pages; selection itself reads no candidate keys or values. Selecting on this summary alone stays within about a point of the full cache on long-document QA (LongBench-v1), tracks the read-every-key oracle on retrieval-dense RULER down to the smallest budgets, and shows its largest margins on long-form reasoning (AIME26, MATH-500), where baseline selectors collapse. At its shipped $2048$-token budget LOCKS matches FullKV aggregate quality at $100$K$+$ context while attending about $2\%$ of the tokens, and halves per-token decode latency ($2.0\times$ at $1$M tokens) against dense attention. LOCKS ships as a drop-in plugin for unmodified vLLM, with batched decode running in full CUDA graphs.