One-Shot Sensitivity-Aware Mixed Sparsity Pruning for Large Language Models
作者: Hang Shao, Bei Liu, Bo Xiao, Ke Zeng, Guanglu Wan, Yanmin Qian
分类: cs.CL, cs.AI
发布日期: 2023-10-14 (更新: 2024-04-23)
备注: Accepted to ICASSP2024
💡 一句话要点
提出基于Hessian敏感度的混合稀疏剪枝方法以提升LLM效率
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 稀疏剪枝 Hessian敏感度 模型压缩 量化技术
📋 核心要点
- 现有大型语言模型(LLMs)在实际应用中因推理延迟高而受到限制,亟需提高其效率。
- 本文提出了一种基于Hessian敏感度的混合稀疏剪枝方法,能够在不重新训练的情况下实现高达50%的稀疏度。
- 实验结果表明,该方法在高稀疏度下表现优越,并且与量化技术兼容,进一步提升了模型压缩效果。
📝 摘要(中文)
各种大型语言模型(LLMs)如生成预训练变换器(GPT)在文本生成任务中表现出色,但其庞大的模型规模导致高推理延迟,限制了实际应用。因此,通过量化、剪枝等手段提高LLM的效率成为关键问题。本文提出了一种基于Hessian敏感度的混合稀疏剪枝方法,能够在不需要重新训练的情况下将LLM剪枝至至少50%的稀疏度。该方法根据敏感度自适应分配稀疏度,减少剪枝引起的误差,同时保持整体稀疏水平。该方法在稀疏度极高时优势更为明显,并且与量化兼容,进一步压缩LLM。我们已发布相关代码。
🔬 方法详解
问题定义:本文旨在解决大型语言模型(LLMs)在推理过程中因模型规模庞大而导致的高延迟问题。现有的剪枝方法通常需要重新训练,增加了计算成本和时间。
核心思路:提出的Hessian敏感度-aware混合稀疏剪枝方法通过分析模型参数的敏感度,自适应地分配稀疏度,从而在保持模型性能的同时实现高稀疏度。
技术框架:该方法的整体架构包括敏感度分析模块、稀疏度分配模块和剪枝实施模块。首先,通过Hessian矩阵计算参数的敏感度,然后根据敏感度动态调整稀疏度,最后实施剪枝操作。
关键创新:本研究的主要创新在于结合Hessian敏感度进行混合稀疏剪枝,避免了传统方法的重训练需求,显著降低了剪枝引起的误差。
关键设计:在参数设置上,采用了基于Hessian矩阵的敏感度计算方法,损失函数设计考虑了剪枝后的模型性能保持,网络结构上则支持与量化技术的兼容性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提方法在不重新训练的情况下,成功将大型语言模型的稀疏度提升至50%以上,且在高稀疏度条件下,模型性能保持良好。与基线方法相比,推理延迟显著降低,展示了该方法的有效性和实用性。
🎯 应用场景
该研究具有广泛的应用潜力,尤其在需要高效推理的场景中,如实时对话系统、智能助手和自动文本生成等。通过提升大型语言模型的效率,可以更好地满足实际应用需求,推动AI技术的普及与发展。
📄 摘要(原文)
Various Large Language Models~(LLMs) from the Generative Pretrained Transformer(GPT) family have achieved outstanding performances in a wide range of text generation tasks. However, the enormous model sizes have hindered their practical use in real-world applications due to high inference latency. Therefore, improving the efficiencies of LLMs through quantization, pruning, and other means has been a key issue in LLM studies. In this work, we propose a method based on Hessian sensitivity-aware mixed sparsity pruning to prune LLMs to at least 50% sparsity without the need of any retraining. It allocates sparsity adaptively based on sensitivity, allowing us to reduce pruning-induced error while maintaining the overall sparsity level. The advantages of the proposed method exhibit even more when the sparsity is extremely high. Furthermore, our method is compatible with quantization, enabling further compression of LLMs. We have released the available code.