Scaling Laws of RoPE-based Extrapolation

📄 arXiv: 2310.05209v2 📥 PDF

作者: Xiaoran Liu, Hang Yan, Shuo Zhang, Chenxin An, Xipeng Qiu, Dahua Lin

分类: cs.CL, cs.AI

发布日期: 2023-10-08 (更新: 2024-03-13)

备注: 26 pages, 12 figures, Accepted by ICLR 2024


💡 一句话要点

提出RoPE扩展的缩放法则以提升LLM的外推能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 旋转位置嵌入 外推能力 长上下文 语言模型 微调 性能提升 缩放法则

📋 核心要点

  1. 现有的RoPE模型在外推能力上存在限制,尤其是在处理长上下文时表现不佳。
  2. 本文提出通过调整RoPE的基数和微调上下文长度来提升外推性能,形成统一的缩放法则框架。
  3. 实验结果显示,使用该方法在LLaMA2模型上实现了显著的外推能力提升,达到1百万上下文长度。

📝 摘要(中文)

基于旋转位置嵌入(RoPE)的语言模型外推能力是当前的研究热点。本文观察到,通过在预训练上下文长度中使用更小或更大的基数进行微调,可以显著提升RoPE模型的外推性能。我们提出了"RoPE扩展的缩放法则"这一统一框架,从周期性角度描述外推性能与基数及微调上下文长度之间的关系。此外,我们还解释了RoPE外推问题的起源,即"外推的临界维度"。在实验中,我们在LLaMA2 7B和13B模型上实现了在仅16K训练长度下的1百万上下文长度的外推。

🔬 方法详解

问题定义:本文旨在解决基于RoPE的语言模型在长上下文外推能力不足的问题。现有方法主要通过固定的基数和上下文长度进行微调,导致外推性能受限。

核心思路:我们提出通过调整RoPE的基数和微调上下文长度来优化外推性能,形成一个统一的框架,揭示了外推性能与这些参数之间的关系。

技术框架:整体架构包括对RoPE的基数进行调整、微调上下文长度的选择,以及通过实验验证外推性能的提升。主要模块包括数据预处理、模型训练和性能评估。

关键创新:最重要的创新在于提出了"RoPE扩展的缩放法则",从周期性角度分析外推性能与基数及上下文长度的关系,这一视角在现有研究中尚未被充分探讨。

关键设计:在实验中,我们选择了不同的基数进行微调,并设置了多种上下文长度,使用LLaMA2 7B和13B模型进行训练,损失函数采用标准的交叉熵损失,确保模型在长上下文下的有效学习。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,使用调整后的RoPE基数和优化的上下文长度,LLaMA2 7B和13B模型在外推能力上实现了显著提升,能够在仅16K训练长度下达到1百万上下文长度,展示了该方法的有效性和潜力。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理中的长文本生成、对话系统以及信息检索等场景。通过提升模型的外推能力,可以更好地处理复杂的语言任务,增强用户体验。未来,该方法有望在多种语言模型中推广应用,推动相关技术的发展。

📄 摘要(原文)

The extrapolation capability of Large Language Models (LLMs) based on Rotary Position Embedding is currently a topic of considerable interest. The mainstream approach to addressing extrapolation with LLMs involves modifying RoPE by replacing 10000, the rotary base of $θ_n={10000}^{-2n/d}$ in the original RoPE, with a larger value and providing longer fine-tuning text. In this work, we first observe that fine-tuning a RoPE-based LLM with either a smaller or larger base in pre-training context length could significantly enhance its extrapolation performance. After that, we propose \textbf{\textit{Scaling Laws of RoPE-based Extrapolation}}, a unified framework from the periodic perspective, to describe the relationship between the extrapolation performance and base value as well as tuning context length. In this process, we also explain the origin of the RoPE-based extrapolation issue by \textbf{\textit{critical dimension for extrapolation}}. Besides these observations and analyses, we achieve extrapolation up to 1 million context length within only 16K training length on LLaMA2 7B and 13B.