Super-Tuning: From Activation-Aware Pruning to Sparse Fine-Tuning

📄 arXiv: 2607.09287v1 📥 PDF

作者: Ivan Ilin, Philip Zmushko, Peter Richtárik

分类: cs.LG, cs.CL

发布日期: 2026-07-10

备注: 26 pages, 3 figures, 19 tables. Code: https://github.com/vectozavr/SuperTuning


💡 一句话要点

提出Super-Tuning以提高大语言模型的稀疏微调效率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 稀疏微调 激活加权 剪枝技术 低秩适配器 参数高效 机器学习

📋 核心要点

  1. 现有的大语言模型微调方法在内存和计算资源上消耗巨大,限制了其应用范围。
  2. 本文提出Super方法,通过激活加权幅度评分选择稀疏的可训练参数,从而提高微调效率。
  3. 实验结果表明,Super/Supra变体在多个配置中实现了最高的准确率,展示了其有效性。

📝 摘要(中文)

大型语言模型(LLMs)的微调成本高昂,主要由于全参数更新需要大量内存、计算资源和每个任务的存储。本文研究了原本用于剪枝的显著性信号是否可以重用于选择模型的适应位置。我们提出了一种稀疏参数高效微调(PEFT)方法Super,该方法通过Wanda风格的激活加权幅度评分来固定少量可训练支持,并在校准过程中计算。我们还引入了Supra,这是一种混合适配器,将稀疏更新与LoRA结合,同时通过简单的预算拆分规则保持匹配的可训练参数预算。在Llama-3.2-1B和Meta-Llama-3-8B的单种子Math17K算术实验中,最佳的Super/Supra变体在测试的调度选择适配器配置中实现了最高的平均准确率。我们还包括了PaFi风格的仅幅度支持作为最接近的无训练稀疏基线,发现低分支持在幅度和Wanda风格排序下都能有效。这些结果表明,简单的剪枝启发式排序可以为PEFT提供有用的固定稀疏支持,尤其是在与低秩适配器结合时。

🔬 方法详解

问题定义:本文旨在解决大型语言模型微调过程中的高资源消耗问题,现有方法在全参数更新时需要大量内存和计算,限制了其应用。

核心思路:论文提出的Super方法通过重用剪枝中的显著性信号,选择模型适应的稀疏参数,从而实现高效微调。结合Wanda风格的激活加权幅度评分,固定少量可训练支持,降低资源需求。

技术框架:整体流程包括两个主要模块:首先进行校准以计算激活加权幅度评分,然后基于评分选择稀疏参数进行微调。Supra适配器则结合了稀疏更新和LoRA,保持可训练参数预算。

关键创新:最重要的创新在于将剪枝启发式排序应用于稀疏微调,提供了有效的固定稀疏支持,尤其在与低秩适配器结合时,显著提高了微调效果。

关键设计:在参数设置上,采用Wanda风格的激活加权幅度评分来选择支持,同时通过简单的预算拆分规则确保可训练参数的合理分配。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,最佳的Super/Supra变体在Llama-3.2-1B和Meta-Llama-3-8B的Math17K算术任务中实现了最高的平均准确率,相较于其他配置表现出显著的性能提升,验证了稀疏微调方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和智能助手等。通过提高大语言模型的微调效率,能够降低资源消耗,使得更多的研究机构和企业能够利用这些先进的模型,推动人工智能技术的普及与应用。

📄 摘要(原文)

Large language models (LLMs) remain expensive to fine-tune because full-parameter updates require substantial memory, compute, and per-task storage. We study whether saliency signals originally developed for pruning can be reused to choose where a model should adapt. We propose Super, a sparse parameter-efficient fine-tuning (PEFT) method that fixes a small trainable support using a Wanda-style activation-weighted magnitude score [Sun et al., 2023] computed from a calibration pass. We then introduce Supra, a hybrid adapter that combines this sparse update with LoRA while preserving a matched trainable-parameter budget through a simple budget-splitting rule. In single-seed Math17K arithmetic experiments on Llama-3.2-1B and Meta-Llama-3-8B, the best Super/Supra variants achieve the highest average accuracy among the tested schedule-selected adapter configurations. We also include a PaFi-style magnitude-only support as a closest training-free sparse baseline and find that low-score supports under both magnitude and Wanda-style orderings can be effective. These results suggest that simple pruning-inspired orderings can provide useful fixed sparse supports for PEFT, especially when combined with low-rank adapters.