C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

📄 arXiv: 2607.17715v1 📥 PDF

作者: Chuheng Du, Junyi Chen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chaoyue Niu, Shengzhong Liu, Guihai Chen, Fan Wu

分类: cs.CL

发布日期: 2026-07-20

备注: 12 pages, 9 figures, accepted by ACM SIGKDD 2026

DOI: 10.1145/3770855.3817715


💡 一句话要点

提出C$^2$KV以解决长上下文LLM推理中的KV缓存存储与访问问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长上下文推理 键值缓存 压缩技术 模块化表示 自然语言处理 推理加速 多文档推理

📋 核心要点

  1. 现有的KV缓存重用方法主要关注计算节省,未能有效解决长上下文LLM服务中的KV缓存存储和访问成本问题。
  2. C$^2$KV提出了一种统一的非前缀KV重用框架,通过学习可组合和压缩的KV缓存流形来优化KV提取和推理时的连接。
  3. 实验结果显示,C$^2$KV在多个长上下文基准和模型系列中显著降低了KV缓存存储和传输成本,实现了高达17倍的推理速度提升。

📝 摘要(中文)

长上下文推理是现代大型语言模型(LLM)应用的核心,如检索增强生成和多文档推理。为降低推理成本,近期研究探索了键值(KV)缓存重用以减少冗余的预填充计算。然而,现有重用方法主要关注计算节省,忽视了长上下文LLM服务中的一个关键瓶颈:存储和访问大型KV缓存的成本。本文提出C$^2$KV,一个统一的非前缀KV重用框架,联合优化KV提取和推理时的连接。C$^2$KV学习一个可组合且压缩的KV缓存流形,明确设计为位置无关。我们的方法引入了一个轻量级的侧车提取器,具有可学习的压缩标记和结构化注意力流,支持模块化的KV表示,能够灵活重用和连接,而无需修改冻结的基础模型。通过压缩-连接共同训练策略,我们对齐提取时的表示与其下游重用行为。大量实验表明,C$^2$KV显著降低KV缓存存储和传输成本,在长上下文下实现高达17倍的推理加速,同时保持生成质量。

🔬 方法详解

问题定义:本文旨在解决长上下文LLM推理中KV缓存存储和访问的高成本问题。现有方法主要集中于计算节省,未能有效处理KV缓存的存储和访问效率。

核心思路:C$^2$KV通过联合优化KV提取和推理时的连接,提出了一种位置无关的可组合和压缩的KV缓存流形,以提高KV缓存的重用效率。

技术框架:C$^2$KV的整体架构包括一个轻量级的侧车提取器,负责生成可学习的压缩标记,以及一个结构化的注意力流,支持模块化的KV表示。该框架允许在不修改基础模型的情况下灵活重用和连接KV表示。

关键创新:C$^2$KV的主要创新在于其压缩-连接共同训练策略,通过对齐提取时的表示与下游重用行为,显著提升了KV缓存的存储和访问效率。与现有方法相比,C$^2$KV在保持生成质量的同时,显著降低了推理成本。

关键设计:该方法的关键设计包括可学习的压缩标记、结构化注意力流以及压缩-连接共同训练策略,确保了KV表示的模块化和灵活性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,C$^2$KV在多个长上下文基准测试中实现了高达17倍的推理速度提升,同时有效降低了KV缓存的存储和传输成本。这一性能提升在保持生成质量的前提下,展示了其在实际应用中的巨大潜力。

🎯 应用场景

C$^2$KV的研究成果在多个领域具有潜在应用价值,尤其是在需要处理长上下文的自然语言处理任务中,如文档检索、对话系统和多文档推理等。通过提高KV缓存的重用效率,该方法能够显著降低推理成本,提升系统的响应速度和用户体验。

📄 摘要(原文)

Long-context inference is central to modern large language model (LLM) applications such as retrieval-augmented generation and multi-document reasoning. To mitigate the growing inference cost, recent work has explored key-value (KV) cache reuse to reduce redundant prefill computation. However, existing reuse methods primarily focus on computation savings and overlook a critical bottleneck in long-context LLM serving: the cost of storing and accessing large KV caches. While KV compression appears to be a natural complement, naively combining compression with non-prefix KV reuse often leads to severe accuracy degradation. In this work, we propose C$^2$KV, a unified framework for non-prefix KV reuse that jointly optimizes KV extraction and inference-time concatenation. C$^2$KV learns a composable and compressed KV cache manifold that is explicitly designed to be position-agnostic. Our approach introduces a lightweight sidecar Extractor with learnable compression tokens and a structured attention flow, enabling modular KV representations that can be flexibly reused and concatenated without modifying the frozen base model. We further employ a compression-concatenation co-training strategy to align extraction-time representations with their downstream reuse behavior. Extensive experiments across multiple long-context benchmarks and model families demonstrate that C$^2$KV significantly reduces KV cache storage and transfer costs, achieving up to 17$\times$ inference speedup under long contexts, while preserving generation quality.