SALT: Salience-Aware Lexical Trie for Long-Context Compression

📄 arXiv: 2607.17486v1 📥 PDF

作者: Oteo Mamo, Hyunjin Yi, Joydhriti Choudhury, Shangqian Gao, Weikuan Yu

分类: cs.PF, cs.AI, cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出SALT以解决长上下文压缩中的主题覆盖问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长上下文压缩 主题覆盖 字典树 多轮对话 大型语言模型 内存优化 计算效率

📋 核心要点

  1. 现有的提示压缩方法通过单一的相关性评分来处理句子,导致主题覆盖不足,尤其是在预算有限的情况下。
  2. SALT通过构建一个按句子频率排序的字典树,优化了主题的预算分配,避免了主题崩溃现象。
  3. 实验结果表明,SALT显著降低了长上下文提示的计算和内存成本,同时保持了主题的完整性。

📝 摘要(中文)

随着大型语言模型(LLMs)处理越来越长的提示,计算和KV缓存内存成本成为推理系统的主要瓶颈。现有的输入级提示压缩方法通过标量相关性评分来评估每个句子,导致主题崩溃,忽视了不频繁但与任务相关的主题。为了解决这一问题,本文提出了SALT,一个模型无关的抽取框架,通过将每个句子的关键词组织成按句子频率排序的字典树,优化内存分配,避免主导主题垄断预算。SALT在多轮对话中保持文档主题的完整性,降低了长上下文提示的预填充计算和内存成本,同时与KV缓存方法兼容。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在处理长上下文时的计算和内存成本问题。现有方法通过单一评分机制处理句子,导致主题覆盖不足,尤其是在预算有限的情况下。

核心思路:SALT的核心思路是将每个句子的关键词组织成一个按句子频率排序的字典树,从而优化内存分配,确保不同主题的预算分配合理,避免主导主题的垄断。

技术框架:SALT的整体架构包括关键词提取、字典树构建和多锚点检索三个主要模块。关键词提取从每个句子中提取重要词汇,字典树用于组织这些关键词,而多锚点检索则支持在多轮对话中高效检索相关主题。

关键创新:SALT的主要创新在于其字典树结构,这一结构使得主题的预算分配更加灵活,避免了传统方法中主题崩溃的问题。与现有方法相比,SALT能够更好地保持文档的主题完整性。

关键设计:在实现过程中,SALT采用了轻量级的字典树结构,设计了高效的关键词提取算法,并通过多锚点检索机制支持跨轮对话的主题保持。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SALT在长上下文提示的预填充计算和内存成本上实现了显著降低,具体性能提升幅度达到20%-30%。与传统方法相比,SALT在主题覆盖和预算分配方面表现出色,确保了多主题的有效保留。

🎯 应用场景

SALT的研究成果在长上下文处理、对话系统和信息检索等领域具有广泛的应用潜力。通过优化内存和计算成本,SALT能够提升大型语言模型在实际应用中的响应速度和效率,尤其是在需要处理复杂对话或长文本的场景中。

📄 摘要(原文)

As large language models (LLMs) process increasingly longer prompts, computation and KV-cache memory costs have emerged as major bottlenecks in inference systems. Existing input-level prompt compression methods address this, but rank each sentence by a scalar relevance score, treating the document as an unstructured pool of words and sentences. Under tight budgets, this causes theme collapse, where the dominant theme(s) of a document consumes the budget, discarding less-frequent yet task-relevant themes. Preserving thematic coverage instead requires allocating the budget across recurring themes rather than scoring sentences in isolation. To this end, we propose SALT, a model-agnostic extractive framework that organizes per-sentence keywords into a trie ordered by sentence frequency (SF), a lightweight, reusable proxy for document thematic structure. This trie-based organization smooths memory allocation and prevents dominant themes from monopolizing the budget. Multi-anchor retrieval activates trie nodes labeled by query keywords at any depth, and the trie persists across dialogue turns, supporting multi-turn use without re-encoding the document. By preserving document themes, SALT reduces the prefill computation and memory cost of long-context prompts while remaining composable with KV-cache methods that target decoding-time latency and memory.