LEMON: Lossless model expansion

📄 arXiv: 2310.07999v1 📥 PDF

作者: Yite Wang, Jiahao Su, Hanlin Lu, Cong Xie, Tianyi Liu, Jianbo Yuan, Haibin Lin, Ruoyu Sun, Hongxia Yang

分类: cs.LG, stat.ML

发布日期: 2023-10-12

备注: Preprint


💡 一句话要点

提出LEMON以解决深度学习模型扩展效率低下问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 深度学习 模型扩展 预训练模型 学习率调度 视觉变换器 BERT 计算效率

📋 核心要点

  1. 现有深度学习模型扩展方法通常需要从头开始训练,效率低下且资源消耗大。
  2. LEMON通过利用小型预训练模型的权重初始化大型模型,并优化学习率调度器,提升训练效率。
  3. 实验证明,LEMON在视觉变换器和BERT上分别减少了56.7%和33.2%的计算成本。

📝 摘要(中文)

深度神经网络,尤其是变换器(Transformers)的扩展对于其性能提升至关重要。然而,现有方法通常需要从头开始训练大型模型,无法利用已训练的小型模型的知识。为了解决这一低效问题,本文提出了LEMON(Lossless model expansion),通过使用小型预训练模型的权重来初始化扩展模型,并采用专门为扩展模型优化的学习率调度器,从而显著减少训练时间。LEMON具有广泛的适用性,兼容多种网络结构,包括视觉变换器和BERT。实验证明,LEMON在训练视觉变换器时计算成本降低了56.7%,在BERT上降低了33.2%。

🔬 方法详解

问题定义:现有的深度学习模型扩展方法通常需要从头开始训练大型模型,这不仅耗时且资源消耗巨大,无法有效利用小型模型的知识。

核心思路:LEMON的核心思想是通过使用小型预训练模型的权重来初始化大型模型,结合专门为扩展模型设计的学习率调度器,从而提高训练效率。

技术框架:LEMON的整体架构包括两个主要阶段:第一阶段是权重初始化,使用小型模型的权重;第二阶段是训练过程,采用优化的学习率调度器。

关键创新:LEMON的创新点在于其无损模型扩展方法,能够有效利用小型模型的知识,避免了从头训练的低效问题。与现有方法相比,LEMON在训练效率上有显著提升。

关键设计:在LEMON中,关键参数设置包括学习率的动态调整策略,以及模型结构的兼容性设计,确保其适用于多种网络架构。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

LEMON在实验中表现出色,视觉变换器的计算成本降低了56.7%,而BERT的计算成本降低了33.2%。这些结果表明,LEMON在模型训练效率方面具有显著优势,能够有效减少资源消耗。

🎯 应用场景

LEMON的研究成果在多个深度学习领域具有广泛的应用潜力,尤其是在需要快速训练大型模型的场景,如自然语言处理和计算机视觉。通过提高模型训练效率,LEMON能够帮助研究人员和工程师更快地迭代和优化模型,推动相关技术的发展。

📄 摘要(原文)

Scaling of deep neural networks, especially Transformers, is pivotal for their surging performance and has further led to the emergence of sophisticated reasoning capabilities in foundation models. Such scaling generally requires training large models from scratch with random initialization, failing to leverage the knowledge acquired by their smaller counterparts, which are already resource-intensive to obtain. To tackle this inefficiency, we present $\textbf{L}$ossl$\textbf{E}$ss $\textbf{MO}$del Expansio$\textbf{N}$ (LEMON), a recipe to initialize scaled models using the weights of their smaller but pre-trained counterparts. This is followed by model training with an optimized learning rate scheduler tailored explicitly for the scaled models, substantially reducing the training time compared to training from scratch. Notably, LEMON is versatile, ensuring compatibility with various network structures, including models like Vision Transformers and BERT. Our empirical results demonstrate that LEMON reduces computational costs by 56.7% for Vision Transformers and 33.2% for BERT when compared to training from scratch.