Extending LLM Context via Associative Recurrent Memory
作者: Gleb Kuzmin, Ivan Rodkin, Aydar Bulatov, Yuri Kuratov, Lyudmila Rvanova, Mikhail Katkov, Ilia Sochenkov, Misha Tsodyks, Timothy Baldwin, Mikhail Burtsev, Artem Shelmanov
分类: cs.CL, cs.AI
发布日期: 2026-07-13
💡 一句话要点
提出关联递归记忆变换器以解决长上下文处理问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长上下文处理 大型语言模型 关联记忆 计算效率 自然语言处理
📋 核心要点
- 现有的标准变换器在处理长上下文时面临计算复杂度和内存使用的限制,难以满足实际应用需求。
- 本文提出关联递归记忆变换器(ARMT),通过结合持续预训练、合成长上下文数据生成和选择性集成记忆来扩展上下文处理能力。
- 实验结果显示,ARMT增强模型能够处理超出原始上下文限制的输入,且在计算效率上比基线模型减少30%的FLOPs。
📝 摘要(中文)
扩展大型语言模型(LLMs)的上下文长度对于许多实际应用至关重要,但标准变换器在计算和内存方面受到限制。本文研究了关联递归记忆变换器(ARMT),作为一种实用的方法来实现LLMs的长上下文处理、恒定内存扩展和更高的效率。我们构建了两个特定领域的长上下文数据集,提出了ARMT的综合训练方案,并进行了广泛的实验研究,结果表明ARMT增强模型在超出原始上下文限制的输入处理上表现良好,且在保持基线性能的同时减少了30%的计算量。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在处理长上下文时的计算复杂度和内存使用问题。现有的标准变换器在长上下文处理上存在性能瓶颈,无法有效扩展。
核心思路:论文提出的关联递归记忆变换器(ARMT)通过引入关联记忆机制,允许模型在不增加计算负担的情况下处理更长的上下文,从而提高了模型的上下文处理能力。
技术框架:ARMT的整体架构包括多个模块,首先进行持续的预训练,然后生成合成的长上下文数据,接着采用课程学习策略,最后在选定的模型层中集成关联记忆。
关键创新:ARMT的主要创新在于其引入的关联记忆机制,使得模型能够在处理超出原始上下文限制的输入时,保持性能不下降,并且显著降低计算需求。
关键设计:在训练过程中,采用了特定的损失函数和网络结构设计,确保模型能够有效学习长上下文的特征,同时在不同层次上选择性地集成记忆模块,以优化性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,ARMT增强模型能够处理超出原始上下文限制的输入而不降低性能,同时在计算效率上减少了30%的FLOPs,相较于基线模型表现出更好的泛化能力。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和信息检索等。通过提高大型语言模型的上下文处理能力,ARMT可以在更复杂的任务中提供更准确的结果,具有显著的实际价值和未来影响。
📄 摘要(原文)
Extending the context length of large language models (LLMs) is critical for many real-world applications, yet standard transformers remain constrained by quadratic compute and linear memory scaling. In this work, we investigate the Associative Recurrent Memory Transformer (ARMT) as a practical approach for enabling long-context processing in LLMs, constant memory scaling, and better efficiency. We make three main contributions. First, we construct two domain-specific long-context datasets designed to evaluate realistic workloads, focusing on narrow-domain fine-tuning scenarios. Second, we propose a comprehensive training recipe for ARMT-based context extension, combining continued pre-training, synthetic long-context data generation, curriculum learning, and selective integration of associative memory into chosen model layers. Third, we present an extensive experimental study demonstrating that ARMT-augmented models: (i) process inputs well beyond their original context limits without degrading performance relative to in-limit baselines; (ii) generalize more effectively to out-of-distribution context lengths; and (iii) need 30% less FLOPs while preserving baseline performance within the original context window.