LoRAShear: Efficient Large Language Model Structured Pruning and Knowledge Recovery

📄 arXiv: 2310.18356v2 📥 PDF

作者: Tianyi Chen, Tianyu Ding, Badal Yadav, Ilya Zharkov, Luming Liang

分类: cs.CL, cs.AI, cs.LG

发布日期: 2023-10-24 (更新: 2023-10-31)

🔗 代码/项目: GITHUB


💡 一句话要点

提出LoRAShear以解决大语言模型的高计算成本问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 结构剪枝 知识恢复 动态微调 LoRA模块 模型压缩 计算效率

📋 核心要点

  1. 现有大语言模型在计算和存储上消耗巨大,导致应用受限,亟需高效的剪枝和知识恢复方法。
  2. LoRAShear通过创建LoRA模块的依赖图,识别可移除结构并进行渐进式剪枝,同时实现知识转移以保留重要信息。
  3. 实验结果显示,LoRAShear在减少20%模型体积的同时,仅导致1.0%的性能下降,表现优于现有技术。

📝 摘要(中文)

大语言模型(LLMs)在人工智能领域引发了变革,但其庞大的体积带来了显著的计算成本挑战。本文介绍了一种新颖的高效结构性剪枝和知识恢复方法LoRAShear。该方法首先通过LoRA模块创建依赖图,以发现最小的可移除结构并分析知识分布。接着,LoRAShear对LoRA适配器进行渐进式结构剪枝,并实现内在知识转移,以更好地保留冗余结构中的信息。为恢复剪枝过程中丢失的知识,LoRAShear提出了一种动态微调方案,结合动态数据适配器,有效缩小与完整模型的性能差距。数值结果表明,LoRAShear在仅使用一台GPU的情况下,能够在几天内将LLMs的占用空间减少20%,且性能仅下降1.0%,显著优于现有方法。

🔬 方法详解

问题定义:本文旨在解决大语言模型的高计算成本和存储需求,现有方法在剪枝过程中往往导致知识损失,影响模型性能。

核心思路:LoRAShear的核心思路是通过分析LoRA模块的依赖关系,进行结构性剪枝,并通过动态微调恢复剪枝过程中丢失的知识。这样的设计旨在在减少模型体积的同时,尽量保留其性能。

技术框架:LoRAShear的整体框架包括依赖图的构建、渐进式结构剪枝、知识转移和动态微调四个主要模块。首先构建依赖图以识别可移除的结构,然后进行剪枝,最后通过动态微调恢复知识。

关键创新:LoRAShear的创新点在于其动态微调方案和动态数据适配器的结合,能够有效缩小剪枝后模型与完整模型之间的性能差距,这是与现有方法的本质区别。

关键设计:在设计中,LoRAShear采用了特定的损失函数来平衡剪枝和知识恢复的目标,同时在动态微调阶段引入了适应性数据选择机制,以提高微调效果。具体的参数设置和网络结构细节将在代码中提供。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LoRAShear在仅使用一台GPU的情况下,能够在几天内将大语言模型的占用空间减少20%,而性能仅下降1.0%。这一结果显著优于现有的最先进技术,展示了其在模型压缩和知识恢复方面的有效性。

🎯 应用场景

LoRAShear的研究成果在多个领域具有潜在应用价值,尤其是在资源受限的环境中,如移动设备和边缘计算。通过高效的模型剪枝和知识恢复,能够使得大语言模型在保持性能的同时,降低计算和存储成本,推动其在实际应用中的普及。

📄 摘要(原文)

Large Language Models (LLMs) have transformed the landscape of artificial intelligence, while their enormous size presents significant challenges in terms of computational costs. We introduce LoRAShear, a novel efficient approach to structurally prune LLMs and recover knowledge. Given general LLMs, LoRAShear at first creates the dependency graphs over LoRA modules to discover minimally removal structures and analyze the knowledge distribution. It then proceeds progressive structured pruning on LoRA adaptors and enables inherent knowledge transfer to better preserve the information in the redundant structures. To recover the lost knowledge during pruning, LoRAShear meticulously studies and proposes a dynamic fine-tuning schemes with dynamic data adaptors to effectively narrow down the performance gap to the full models. Numerical results demonstrate that by only using one GPU within a couple of GPU days, LoRAShear effectively reduced footprint of LLMs by 20% with only 1.0% performance degradation and significantly outperforms state-of-the-arts. The source code will be available at https://github.com/microsoft/lorashear.