Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D

📄 arXiv: 2607.16072 📥 PDF

作者: Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu

分类: cs.CL

发布日期: 2026-07-20


💡 一句话要点

提出2D-RoPE以解决语言模型复制问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语言模型 位置编码 2D网格 文本复制 Transformer 深度学习 自然语言处理

📋 核心要点

  1. 核心问题:现有的语言模型在复制输入字符串时表现不佳,尤其是在长文本情况下,导致模型无法准确定位输入位置。
  2. 方法要点:论文提出2D-RoPE,通过将文本组织为2D网格,简化了复制任务,使得模型更容易学习和执行复制操作。
  3. 实验或效果:在合成复制实验中,使用2D-RoPE的模型在输入长度上表现出显著提升,完美复制率远超传统位置编码模型。

📝 摘要(中文)

尽管大型语言模型(LLMs)能够快速解决复杂推理问题,但我们发现即使是最先进的模型在执行简单的字符串复制操作时也存在困难。我们将这一失败归因于Transformer架构中的位置编码,其归纳偏差更倾向于通过匹配局部上下文的快捷方式进行复制,而不是仔细定位相应的输入位置。为了解决这一问题,我们提出了2D-RoPE,将文本组织成2D网格而非1D序列,并为每个标记分配行ID和列ID。在这种视角下,复制变为简单的在固定列偏移量处检索输入标记,使得任务更易于学习。在合成复制实验中,使用2D-RoPE的浅层Transformer在输入长度远超训练时的情况下实现了完美复制,而标准位置编码则远远落后。我们进一步展示了2D-RoPE语言模型在复制任务上的优势在大规模预训练中始终保持一致,模型规模高达14亿参数。总体而言,我们的结果表明以2D方式查看文本可以有利于语言建模,期望能激励未来的研究进一步探索2D位置编码的潜力。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型在复制输入字符串时的困难,现有方法在长文本情况下无法准确定位输入位置,导致复制失败。

核心思路:论文提出的2D-RoPE方法通过将文本组织为2D网格,赋予每个标记行ID和列ID,使得复制操作变为简单的列偏移检索,从而降低了学习难度。

技术框架:整体架构包括文本的2D网格表示、行列ID的分配以及基于列偏移的检索机制。模型通过这种新结构进行训练,以提高复制性能。

关键创新:2D-RoPE是本研究的核心创新点,与传统的1D位置编码方法相比,2D-RoPE通过改变文本表示方式,显著提升了复制任务的准确性和效率。

关键设计:在模型设计中,关键参数包括行和列的ID分配方式,损失函数的选择,以及网络结构的调整,以适应新的2D表示形式。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在合成复制实验中,使用2D-RoPE的浅层Transformer在输入长度达到数百倍于训练时的情况下实现了完美复制,而标准位置编码模型的表现则显著落后,显示出2D-RoPE在复制任务中的明显优势。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理中的文本生成、信息检索和对话系统等。通过改进语言模型的复制能力,2D-RoPE可提升模型在长文本处理中的表现,具有实际应用价值。未来,2D位置编码的探索可能会推动更广泛的语言建模技术进步。

📄 摘要(原文)

While large language models (LLMs) can solve advanced reasoning problems in seconds, we show that even frontier models fail to perform a much simpler operation: exactly copying an input string that lies well within their context windows. We attribute this failure to positional encodings in Transformer architectures, whose inductive bias favors copying through a shortcut based on matching local contexts rather than carefully locating the corresponding input positions. To address this issue, we introduce 2D-RoPE, which organizes text into a 2D grid rather than a 1D sequence and assigns each token a row ID and a column ID. Under this view, copying becomes simply retrieving input tokens at a fixed column offset, which makes the task easy to learn. In synthetic copy experiments, shallow Transformers with 2D-RoPE achieve perfect copying at input lengths hundreds of times longer than those seen during training, whereas standard positional encodings fall far behind. We further show that the advantage of 2D-RoPE language models on copy tasks consistently holds in large-scale pretraining on DCLM with model sizes up to 1.4B parameters. Overall, our results suggest that viewing text in 2D can benefit language modeling, and we hope this encourages future work to further explore the potential of 2D positional encodings.