Loop the Loopies!

📄 arXiv: 2607.16051 📥 PDF

作者: Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai

分类: cs.CL, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出Loopie以解决循环Transformer性能不足问题

🎯 匹配领域: 支柱五:交互与反应 (Interaction & Reaction)

关键词: 循环Transformer 混合专家 推理能力 模型优化 性能提升

📋 核心要点

  1. 循环Transformer在计算资源增加时,参数数量的提升未能有效提升模型性能,存在显著的性能瓶颈。
  2. Loopie通过引入混合专家模型和后训练管道,优化了循环Transformer的结构与推理能力,解决了现有方法的不足。
  3. 实验结果显示,Loopie在相同计算预算下显著超越了传统Transformer模型,展现出卓越的推理能力和性能提升。

📝 摘要(中文)

我们提出了Loopie,这是迄今为止最强大的循环Transformer系列。Loopie系列包括两个混合专家(MoE)模型:一个具有200亿参数、20亿活跃参数的模型和一个具有60亿参数、6亿活跃参数的模型。循环Transformer长期以来面临一个挑战:在预训练计算量增加N倍的情况下,参数数量增加N倍通常优于将模型循环N次。Loopie解决了这一挑战。大量消融研究,包括与普通30B-A3B模型的比较,表明Loopie在相同计算预算下显著超越了普通Transformer基线。我们的新型后训练管道赋予Loopie强大的推理能力。在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中,Loopie在没有工具的情况下实现了金牌表现。

🔬 方法详解

问题定义:论文要解决的具体问题是循环Transformer在计算资源增加时,参数数量提升未能有效提升模型性能,导致性能瓶颈。现有方法在增加计算量时,通常无法实现预期的性能提升。

核心思路:论文的核心解决思路是通过引入混合专家(MoE)模型和创新的后训练管道,优化循环Transformer的结构设计,从而提升模型的推理能力和整体性能。这样的设计旨在充分利用计算资源,避免简单的参数增加带来的性能提升限制。

技术框架:整体架构包括两个主要模块:混合专家模型和后训练管道。混合专家模型通过动态选择活跃参数来提高计算效率,而后训练管道则增强了模型的推理能力。

关键创新:最重要的技术创新点在于Loopie系列模型的设计,特别是其混合专家架构和后训练策略,这与现有的普通Transformer模型在结构和训练方式上存在本质区别。

关键设计:关键的参数设置包括200亿和60亿参数的模型设计,以及活跃参数的动态选择机制。损失函数和网络结构经过精心设计,以确保模型在推理任务中的高效性和准确性。通过这些设计,Loopie能够在相同计算预算下实现更优的性能。

📊 实验亮点

实验结果表明,Loopie在相同计算预算下显著超越了传统的30B-A3B模型,展现出更强的推理能力。在2025年IMO和IPhO中,Loopie实现了金牌表现,证明了其在实际应用中的卓越性能。

🎯 应用场景

该研究的潜在应用场景包括高性能自然语言处理、智能问答系统和复杂推理任务等领域。Loopie的强大推理能力和高效计算使其在需要快速响应和高准确度的应用中具有重要价值,未来可能推动更多智能系统的开发与应用。

📄 摘要(原文)

We present Loopie, the most powerful looped Transformer to date. The Loopie series consists of two Mixture-of-Experts (MoE) models: a 20B-parameter model with 2B active parameters and a 6Bparameter model with 0.6B active parameters. Looped Transformers have long faced a challenge: given an N-fold increase in pre-training compute, increasing the parameter count by a factor of N usually outperforms looping a model N times. Loopie addresses this challenge. Extensive ablation studies, including comparisons with a vanilla 30B-A3B model, show that Loopie substantially outperforms vanilla Transformer baselines trained with the same compute budget. Our novel post-training pipeline equips Loopie with strong reasoning abilities. At the 2025 IMO and IPhO, Loopie achieves gold-medal performance without tools.