LILA: Calibration-Free Structured Pruning of Large Language Models via Latent Spectral Geometry

📄 arXiv: 2609.11163v1 📥 PDF

作者: Sankar Behera, Dhruv Singh, Anshika Agnihotri, Raj Kumar Choudhary, Satyadev Ahlawat, Yamuna Prasad

分类: cs.LG, cs.CL

发布日期: 2026-09-10


💡 一句话要点

提出LILA以解决大语言模型结构化剪枝中的校准问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 结构化剪枝 无校准方法 Kolmogorov-Smirnov距离 神经元重要性 LoRA微调 性能提升

📋 核心要点

  1. 现有的大语言模型剪枝方法依赖于校准数据和复杂的辅助网络,限制了其应用的灵活性和效率。
  2. LILA通过KS距离评估神经元重要性,提供了一种无需训练和校准数据的结构化剪枝方法,简化了剪枝过程。
  3. 实验结果显示,LILA在多个稀疏度水平上均超越了现有基线,且在微调后与重校准模型的性能相当,展现了其有效性。

📝 摘要(中文)

结构化剪枝大语言模型(LLMs)提供了硬件高效的压缩,但现有方法需要校准数据、梯度计算或大型辅助策略网络。LILA(潜在信息层分析)通过全连接前馈网络(FFN)权重矩阵的经验奇异值分布与神经元消融后的分布之间的Kolmogorov-Smirnov(KS)距离来评分神经元重要性,提供了一种无需训练、校准数据或辅助网络的闭式谱规则。在不进行微调的情况下,LILA在25%稀疏度下的零-shot准确率上超越了PruneNet(45M参数RL策略)1.57个百分点,并在所有稀疏度水平上超越了WikiText-2校准的SliceGPT,最高提升6.0个百分点,同时保持原始架构。经过一次LoRA恢复微调,LILA在LLaMA-2-7B和Phi-2上与经过大量校准的SliceGPT基线的性能差距仅为0.48个百分点,尽管未使用任何校准数据。

🔬 方法详解

问题定义:本论文旨在解决大语言模型的结构化剪枝问题,现有方法通常需要校准数据和复杂的辅助网络,导致剪枝过程繁琐且效率低下。

核心思路:LILA通过计算全连接前馈网络权重矩阵的经验奇异值分布与消融后的分布之间的KS距离,来评估神经元的重要性,从而实现剪枝,无需额外的训练或校准数据。

技术框架:LILA的整体架构包括三个主要模块:1) 计算全连接前馈网络的奇异值分布;2) 评估神经元的重要性;3) 执行结构化剪枝,保留原始网络架构。

关键创新:LILA的主要创新在于其闭式谱规则的提出,使得剪枝过程无需依赖校准数据和复杂的策略网络,与现有方法相比显著简化了流程。

关键设计:在实现过程中,LILA使用KS距离作为重要性评分标准,确保了在不同稀疏度下的有效性,并通过一次LoRA恢复微调进一步提升了模型性能。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

LILA在25%稀疏度下的零-shot准确率超越了PruneNet 1.57个百分点,并在所有稀疏度水平上超越了SliceGPT,最高提升6.0个百分点。经过一次LoRA微调后,LILA与重校准模型的性能差距仅为0.48个百分点,展现了其优越性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和文本生成等。LILA的无校准剪枝方法能够显著提高大语言模型的硬件效率,降低计算资源消耗,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Structured pruning of large language models (LLMs) offers hardware-efficient compression, yet existing methods require calibration data, gradient computation, or large auxiliary policy networks at pruning time. LILA (\emph{Latent-Informed Layer Analysis}) scores neuron importance via the Kolmogorov--Smirnov (KS) distance between empirical singular value distributions of the full and neuron-ablated feed-forward network (FFN) weight matrix, providing a closed-form spectral rule requiring no training, calibration data, or auxiliary network. Without any fine-tuning, LILA surpasses PruneNet (45M-parameter RL policy) by 1.57~pp in zero-shot accuracy on LLaMA-2-7B at 25\% sparsity, and outperforms WikiText-2-calibrated SliceGPT by up to 6.0~pp across all sparsity levels, while preserving the original architecture. After one epoch of LoRA recovery fine-tuning, LILA achieves highly competitive performance, matching the heavily calibrated SliceGPT baseline to within a 0.48~pp margin across LLaMA-2-7B and Phi-2, despite using zero calibration data. A Neural Tangent Kernel analysis confirms a 22$\times$ reduction in functional distortion versus random pruning, providing theoretical grounding for the spectral importance criterion. Finally, extending LILA to dynamically allocate sparsity budgets via KS-scores yields state-of-the-art generative preservation at moderate compression, while uncovering fundamental single-layer architectural bottlenecks at higher compression regimes.