Forward-Free LLM Depth Pruning via Weight Redundancy
作者: Vincent-Daniel Yun, Woosang Lim
分类: cs.LG, cs.AI, cs.PF
发布日期: 2026-09-09
💡 一句话要点
提出权重冗余剪枝方法以解决LLM推理成本问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 深度剪枝 大型语言模型 Transformer 权重冗余 无前向传播 自然语言处理 计算效率
📋 核心要点
- 现有的深度剪枝方法在推理过程中需要依赖前向传播,导致计算成本高且效率低。
- 本文提出的WRP方法通过权重冗余估计层间相似性,避免了前向传播的需求,从而实现高效剪枝。
- 实验结果表明,WRP在多种设置下表现优异,超越了现有的无前向剪枝方法,接近基于激活的方法性能。
📝 摘要(中文)
深度剪枝通过移除完整的Transformer块来降低大型语言模型(LLM)的推理成本。现有的基于激活的方法需要通过前向传播收集隐藏状态,而现有的无前向传播方法则单独评分每个Transformer块,未考虑块之间的相似性。本文提出了一种名为权重冗余剪枝(WRP)的无前向深度剪枝方法,该方法通过检查点权重估计层间冗余,从而在不需要校准数据或模型前向传播的情况下选择块。WRP比较层间的注意力输出和MLP降维权重,并结合它们的成对相似性与相对投影规模信息。生成的全对相似性矩阵指导层的分组和块的选择。在多种剪枝设置、模型家族和下游任务中,WRP始终优于现有的无前向幅度剪枝方法,并接近基于激活的方法的性能。
🔬 方法详解
问题定义:本文旨在解决大型语言模型推理中的高计算成本问题。现有方法通常依赖前向传播来收集激活信息,导致效率低下和计算资源浪费。
核心思路:WRP方法通过分析模型权重中的冗余性,利用层间的相似性来选择需要保留的Transformer块,从而实现无前向传播的高效剪枝。
技术框架:WRP的整体流程包括:首先,从模型的检查点权重中提取注意力输出和MLP降维权重;其次,计算这些权重之间的成对相似性;最后,结合相对投影规模信息生成全对相似性矩阵,以指导层的分组和块的选择。
关键创新:WRP的主要创新在于其无前向传播的剪枝策略,通过权重冗余分析实现了对Transformer块的有效选择,显著提高了剪枝效率。与传统方法相比,WRP不再依赖于激活信息,降低了计算复杂度。
关键设计:WRP在设计上注重权重的成对比较,采用了相对投影规模信息来增强相似性评估的准确性。具体的参数设置和损失函数设计尚未详细说明,可能为未知。实验中使用了多种模型和任务以验证其有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,WRP在多种剪枝设置下均优于现有的无前向幅度剪枝方法,且在多个下游任务中接近基于激活的方法性能,展现出显著的提升幅度,具体数值未提供。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、机器翻译和对话系统等。通过降低大型语言模型的推理成本,WRP方法能够使得这些技术在资源受限的环境中更具可行性,推动AI技术的广泛应用与发展。
📄 摘要(原文)
Depth pruning reduces large language model (LLM) inference cost by removing complete Transformer blocks. Activation-based methods collect hidden states through forward passes on calibration data, while existing forward-free methods score each Transformer block separately without measuring similarity between blocks. We propose Weight-Redundancy Pruning (WRP), a forward-free depth-pruning method that estimates inter-layer redundancy from checkpoint weights to select blocks without calibration data or model forward passes. WRP compares attention output and MLP down-projection weights across layers and combines their pairwise similarities with relative projection-scale information. The resulting all-pairs similarity matrix guides layer grouping and block selection. Across multiple pruning settings, model families, and downstream tasks, WRP consistently outperforms existing forward-free magnitude pruning and approaches the performance of activation-based methods.