Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

📄 arXiv: 2609.05275v1 📥 PDF

作者: Mostafa Elhoushi, Alex Pretko, Nolan Dey, Bin Claire Zhang, Gavia Gray, Gurpreet Gosal, Abdulrahman Mahmoud, Shane Bergsma, Joel Hestness

分类: cs.AI

发布日期: 2026-09-04

备注: This is a slightly extended version of the paper published at ICML 2026

期刊: Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)


💡 一句话要点

优化层稀疏性以提高大型语言模型的训练与推理效率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 层丢弃 大型语言模型 训练优化 推理加速 超参数优化 深度学习

📋 核心要点

  1. 现有的大型语言模型在预训练中逐渐忽视层丢弃,导致训练效率和准确性下降。
  2. 论文提出在LLM训练中重新引入层丢弃,通过优化层分布和超参数设置来提升训练效果。
  3. 实验结果显示,使用层丢弃可以在节省训练资源的同时,降低损失并实现推理速度的显著提升。

📝 摘要(中文)

层丢弃(即随机深度)已被证明能够加速训练、提高准确性并增强对零-shot层剪枝的鲁棒性。然而,随着模型和数据集的规模扩大,层丢弃在大型语言模型(LLMs)的预训练中逐渐被忽视。本文展示了在最先进的LLM训练中应使用层丢弃,并建立了训练和后训练的最佳实践及规模分析。通过优化层分布、时间调度和优化器超参数,发现层丢弃在相同训练FLOPs下能够降低损失,并在节省高达25%训练FLOPs的同时实现相似的验证损失。此外,层丢弃还支持显著的后训练优化,如早期退出、中间层跳过和自我推测解码,实现高达1.5倍的推理加速,且准确性损失微乎其微。通过2400多个实验,验证了这些发现对大规模训练的可靠性。

🔬 方法详解

问题定义:本文旨在解决层丢弃在大型语言模型预训练中被忽视的问题,现有方法未能充分利用层丢弃的优势,导致训练效率和模型性能的下降。

核心思路:论文的核心思路是重新引入层丢弃,通过优化层的分布、时间调度和优化器的超参数设置,来提升训练过程中的效率和模型的准确性。

技术框架:整体架构包括三个主要模块:层丢弃的实施、超参数的优化以及后训练优化策略。首先,在训练过程中应用层丢弃,其次,通过调整超参数来优化训练效果,最后,利用层丢弃的特性进行后训练优化。

关键创新:最重要的技术创新在于系统性地分析和量化层丢弃对训练和推理的影响,提出了最佳实践,并展示了层丢弃在大规模训练中的有效性。与现有方法相比,本文提供了更为全面的实证数据支持。

关键设计:关键设计包括优化的层分布、时间调度策略和特定的优化器超参数设置。实验中还探索了不同的损失函数和网络结构,以确保在使用层丢弃时能够最大化模型性能。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,在相同的训练FLOPs下,使用层丢弃可以降低损失,并在节省高达25%训练FLOPs的同时实现相似的验证损失。此外,层丢弃还支持高达1.5倍的推理速度提升,且准确性损失微乎其微,显示出显著的性能优势。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、计算机视觉等需要高效训练和推理的大型模型。通过优化层丢弃的使用,可以显著提高模型的训练效率和推理速度,降低计算资源消耗,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Layer dropout (a.k.a. stochastic depth) has been shown to enable faster training, higher accuracy, and robustness to zero-shot layer pruning in both language and vision transformers. However, as models and datasets have scaled, dropout - particularly layer dropout - has largely disappeared from large language models (LLMs) pre-training recipes. While some prior work has reported that dropout can degrade accuracy, no comprehensive study has quantified, let alone mitigated, this effect. In this study, we show that layer dropout should be used in state-of-the-art LLM training, establishing best practices and scaling analysis for both training and post-training benefits. Concretely, with optimal layer distribution, time schedule, and optimizer hyperparameters, we observe that at the same training FLOPs layer dropout leads to lower loss. For a given number of training steps, LLMs can achieve lower or similar validation loss while saving upto 25% of training FLOPs. Moreover, layer dropout enables significant post-training optimizations, such as early exit, intermediate-layer skipping, and self-speculative decoding, yielding up to 1.5x inference speedup with negligible accuracy loss. Across more than 2400 training experiments, spanning models from 271M to 8.2B parameters and datasets up to 160B tokens, we demonstrate that these findings extend reliably to large-scale training regimes. All pre-training experiments were run on Cerebras CS-3 systems.