Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

📄 arXiv: 2607.08027v1 📥 PDF

作者: Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita, Hironobu Fujiyoshi, Yasunori Ishii, Tomoyuki Okuno, Kazuki Kozuka

分类: cs.CL, cs.AI

发布日期: 2026-07-09


💡 一句话要点

提出改进的结构化剪枝方法以解决大语言模型的适应性特征保留问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 结构化剪枝 适应性特征保留 大语言模型 非线性分布对齐 异常值去除 推理速度提升 机器学习

📋 核心要点

  1. 现有的无结构剪枝技术在应用于结构化剪枝时面临分布不匹配、符号信息丢失和异常值影响等挑战。
  2. 论文提出了一种结合幂变换、保符号评分聚合和异常值去除的统一方法,以解决上述问题。
  3. 实验结果表明,该方法在保持准确性的同时,显著提升了推理速度,效果优于传统的剪枝方法。

📝 摘要(中文)

本文提出了一种改进的结构化剪枝方法,旨在解决将适应性特征保留(AFR)这一无结构剪枝技术应用于结构化剪枝时所面临的关键挑战。具体而言,AFR在结构化剪枝中会出现三大问题:异构剪枝评分之间的分布不匹配、指示优化方向一致性的符号信息丢失以及异常值的影响。为了解决这些问题,本文提出了一种统一的方法,结合了非线性分布对齐的幂变换、保符号的评分聚合和基于百分位的异常值去除。通过在Llama-3-8B、Vicuna-v1.5-13B和LLaVA-v1.5-13B上的实验,验证了该方法在保持与无结构剪枝相当的准确性的同时,通过结构化剪枝实现了实际推理速度的提升。

🔬 方法详解

问题定义:本文旨在解决将适应性特征保留(AFR)技术应用于结构化剪枝时的三大问题:异构剪枝评分的分布不匹配、符号信息的丢失以及异常值的影响,这些问题会导致剪枝效果不理想。

核心思路:提出的解决方案通过幂变换实现非线性分布对齐,利用保符号的评分聚合保持优化方向的一致性,并通过百分位方法去除异常值,从而提高剪枝的有效性和准确性。

技术框架:整体方法分为三个主要模块:首先进行幂变换以对齐评分分布;其次进行保符号评分聚合以确保优化方向一致;最后通过百分位去除异常值,优化剪枝效果。

关键创新:本研究的创新点在于将幂变换与保符号评分聚合相结合,解决了传统方法在结构化剪枝中遇到的多种问题,显著提升了剪枝的有效性。

关键设计:在参数设置上,采用了适应性调整的幂变换参数,并设计了基于百分位的异常值去除策略,以确保剪枝过程中信息的完整性和准确性。实验中使用的损失函数和网络结构经过精心设计,以适应大语言模型的特性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在Llama-3-8B、Vicuna-v1.5-13B和LLaVA-v1.5-13B上均保持了与无结构剪枝相当的准确性,同时实现了推理速度的显著提升,具体提升幅度未知,表明该方法在实际应用中具有良好的效果。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、机器翻译和对话系统等大语言模型相关任务。通过提高模型的推理速度和保持准确性,该方法能够在实际应用中显著提升用户体验,并推动大规模模型在资源受限环境中的应用。未来,该技术可能会促进更多高效模型的开发与应用。

📄 摘要(原文)

This paper proposes an improved structured pruning method for large language models (LLMs) that addresses key challenges in adapting Adaptive Feature Retention (AFR), an unstructured pruning technique, to structured pruning. When applying AFR to structured pruning, three major problems arise: distribution mismatch between heterogeneous pruning scores, loss of sign information indicating optimization direction consistency, and influence of outliers. To address these issues, we propose a unified approach combining power transformation for nonlinear distribution alignment, sign-preserving score aggregation, and percentile-based outlier removal. Experiments on Llama-3-8B, Vicuna-v1.5-13B, and LLaVA-v1.5-13B demonstrate that our method maintains accuracy comparable to unstructured pruning while achieving practical inference speedup through structured pruning.