Forward-Free LLM Depth Pruning via Weight Redundancy

📄 arXiv: 2609.09883v1 📥 PDF

作者: Vincent-Daniel Yun, Woosang Lim

分类: cs.LG, cs.AI, cs.PF

发布日期: 2026-09-09


💡 一句话要点

提出权重冗余剪枝方法以解决LLM推理成本问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 深度剪枝 大型语言模型 Transformer 权重冗余 无前向传播 自然语言处理 计算效率

📋 核心要点

  1. 现有的深度剪枝方法在推理过程中需要依赖前向传播,导致计算成本高且效率低。
  2. 本文提出的WRP方法通过权重冗余估计层间相似性,避免了前向传播的需求,从而实现高效剪枝。
  3. 实验结果表明,WRP在多种设置下表现优异,超越了现有的无前向剪枝方法,接近基于激活的方法性能。

📝 摘要(中文)

深度剪枝通过移除完整的Transformer块来降低大型语言模型(LLM)的推理成本。现有的基于激活的方法需要通过前向传播收集隐藏状态,而现有的无前向传播方法则单独评分每个Transformer块,未考虑块之间的相似性。本文提出了一种名为权重冗余剪枝(WRP)的无前向深度剪枝方法,该方法通过检查点权重估计层间冗余,从而在不需要校准数据或模型前向传播的情况下选择块。WRP比较层间的注意力输出和MLP降维权重,并结合它们的成对相似性与相对投影规模信息。生成的全对相似性矩阵指导层的分组和块的选择。在多种剪枝设置、模型家族和下游任务中,WRP始终优于现有的无前向幅度剪枝方法,并接近基于激活的方法的性能。

🔬 方法详解

问题定义:本文旨在解决大型语言模型推理中的高计算成本问题。现有方法通常依赖前向传播来收集激活信息,导致效率低下和计算资源浪费。

核心思路:WRP方法通过分析模型权重中的冗余性,利用层间的相似性来选择需要保留的Transformer块,从而实现无前向传播的高效剪枝。

技术框架:WRP的整体流程包括:首先,从模型的检查点权重中提取注意力输出和MLP降维权重;其次,计算这些权重之间的成对相似性;最后,结合相对投影规模信息生成全对相似性矩阵,以指导层的分组和块的选择。

关键创新:WRP的主要创新在于其无前向传播的剪枝策略,通过权重冗余分析实现了对Transformer块的有效选择,显著提高了剪枝效率。与传统方法相比,WRP不再依赖于激活信息,降低了计算复杂度。

关键设计:WRP在设计上注重权重的成对比较,采用了相对投影规模信息来增强相似性评估的准确性。具体的参数设置和损失函数设计尚未详细说明,可能为未知。实验中使用了多种模型和任务以验证其有效性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,WRP在多种剪枝设置下均优于现有的无前向幅度剪枝方法,且在多个下游任务中接近基于激活的方法性能,展现出显著的提升幅度,具体数值未提供。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、机器翻译和对话系统等。通过降低大型语言模型的推理成本,WRP方法能够使得这些技术在资源受限的环境中更具可行性,推动AI技术的广泛应用与发展。

📄 摘要(原文)

Depth pruning reduces large language model (LLM) inference cost by removing complete Transformer blocks. Activation-based methods collect hidden states through forward passes on calibration data, while existing forward-free methods score each Transformer block separately without measuring similarity between blocks. We propose Weight-Redundancy Pruning (WRP), a forward-free depth-pruning method that estimates inter-layer redundancy from checkpoint weights to select blocks without calibration data or model forward passes. WRP compares attention output and MLP down-projection weights across layers and combines their pairwise similarities with relative projection-scale information. The resulting all-pairs similarity matrix guides layer grouping and block selection. Across multiple pruning settings, model families, and downstream tasks, WRP consistently outperforms existing forward-free magnitude pruning and approaches the performance of activation-based methods.