MemDefrag: Latent Memory Defragmentation for Large Language Models

📄 arXiv: 2607.05969v1 📥 PDF

作者: Ruiyi Yan, Zhuoyuan Mao, Yiwen Guo

分类: cs.CL

发布日期: 2026-07-07


💡 一句话要点

提出MemDefrag以解决大语言模型的潜在记忆碎片化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 潜在记忆 大型语言模型 记忆整理 知识保留 比例遗忘机制 中间层追踪信号 自然语言处理

📋 核心要点

  1. 现有的潜在记忆方法在内存更新时面临性能下降的问题,主要由于位置编码不对齐和缺乏有效的追踪机制。
  2. 本文提出的MemDefrag框架利用中间层的注意力密度信号进行记忆碎片整理,并在容量超出时实施比例遗忘机制。
  3. 实验结果显示,MemDefrag在知识保留方面显著优于MemoryLLM和M+,在50次内存更新后知识保留率达到43.0%。

📝 摘要(中文)

潜在记忆作为一种存储过去知识片段的机制,在大型语言模型中逐渐受到关注。然而,在内存更新过程中,由于位置编码不对齐和缺乏有效的追踪机制,导致性能显著下降。为了解决这一问题,本文提出了MemDefrag,一个无训练且模型无关的框架,利用中间层的追踪信号进行记忆碎片整理,并在容量超出时应用信息引导的比例遗忘机制。实验结果表明,MemDefrag在知识保留和长上下文基准测试中显著优于现有方法,且在不同的LLM和潜在记忆变体中具有良好的泛化能力。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在潜在记忆更新过程中由于位置编码不对齐和缺乏追踪机制导致的性能下降问题。现有方法在内存更新时难以有效区分目标记忆片段与无关片段,影响了知识的保留和利用。

核心思路:MemDefrag的核心思路是利用中间层的注意力密度信号作为追踪机制,进行记忆碎片的整理。通过对存储的记忆片段进行排序、重排和过滤,提升内存的有效性和利用率。

技术框架:MemDefrag框架包括两个主要模块:第一,利用中间层的追踪信号进行记忆碎片整理;第二,当内存容量超出时,应用信息引导的比例遗忘机制,以确保重要知识的保留。

关键创新:MemDefrag的创新点在于提出了无训练、模型无关的记忆整理方法,利用中间层的注意力密度信号作为追踪机制,这一设计与现有方法的本质区别在于其有效性和灵活性。

关键设计:在MemDefrag中,关键设计包括中间层的选择和注意力密度的计算方法,以及比例遗忘机制的具体实现。这些设计确保了在内存更新过程中,能够有效地识别和保留重要的记忆片段。

🖼️ 关键图片

img_0
img_1

📊 实验亮点

实验结果表明,MemDefrag在知识保留方面显著优于MemoryLLM和M+,在50次内存更新后知识保留率达到43.0%,而对比方法仅为17.4%和17.6%。此外,MemDefrag在长上下文基准测试中也表现出色,展示了其良好的泛化能力。

🎯 应用场景

MemDefrag的研究成果在多个领域具有潜在应用价值,尤其是在需要长期记忆和知识保留的自然语言处理任务中,如对话系统、知识问答和个性化推荐等。通过提高大型语言模型的记忆管理能力,能够显著提升其在复杂任务中的表现和用户体验。

📄 摘要(原文)

Latent memory, which stores past knowledge fragments as per-layer hidden states, has emerged as a promising paradigm (e.g., MemoryLLM and M+) for long-term memory in large language models (LLMs). However, the paradigm suffers from significant performance degradation during memory updates, due to positional encoding misalignment and the absence of any tracing mechanism to distinguish target memory fragments from irrelevant ones. To discover such a tracing mechanism, we probe the layer-wise attention density over stored memory fragments, and find that a small set of middle transformer layers consistently concentrates the highest density on the target fragment - exposing an inherent tracing signal. In light of this, we propose MemDefrag, a training-free and model-agnostic framework that (1) uses a middle-layer tracing signal to conduct memory defragmentation (rank, reorder, and filter memories), and (2) applies an informativeness-guided proportional forgetting mechanism once capacity is exceeded. Experiments show that MemDefrag substantially outperforms MemoryLLM and M+ on knowledge retention (e.g., 43.0% vs. 17.4%/17.6% after 50 memory updates) and long-context benchmarks, and generalizes well across various LLMs and latent-memory variants.