Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

📄 arXiv: 2607.21291v1 📥 PDF

作者: Yidu Wu, Xiang Wang, Kejie Zhao, Zhangchi Wang, Qinghai Guo, Xiaoying Tang

分类: cs.CL, cs.LG

发布日期: 2026-07-23

备注: Accepted by ICIC 2026. 12 pages, 2 figures, 4 tables

DOI: 10.1007/978-981-92-3447-9_43


💡 一句话要点

提出自适应深度稀疏框架以降低预训练大语言模型的推理成本

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 深度稀疏化 推理加速 余弦相似度 特征对齐 自然语言处理 模型压缩

📋 核心要点

  1. 现有加速方法依赖于任务特定的微调或从头训练,增加了适应成本并限制了跨任务的可用性。
  2. 提出的自适应深度稀疏框架(AdaDSF)通过层输入和输出的相似性来动态调整层级令牌保留比例。
  3. 在GPT-NeoX和Qwen2.5上,AdaDSF在保持性能的同时显著减少了推理FLOPs,且准确度下降小于强基线方法。

📝 摘要(中文)

大语言模型(LLMs)在生成和推理性能上表现出色,但其Transformer架构导致高推理成本。现有加速方法通常依赖于特定任务的微调或从头训练,增加了适应成本并限制了跨任务的可用性。本文提出了一种自适应深度稀疏框架(AdaDSF),能够在不完全重训练的情况下将现成的预训练LLMs转换为深度稀疏模型。核心思想是不同层对表示转换的贡献不均,通过层输入和输出隐状态之间的余弦相似度进行表征。基于此,AdaDSF从相似性统计中分配层级的令牌保留比例,使用轻量级路由器在每层选择信息性令牌,并引入特征保持对齐目标,以匹配稀疏模型和密集模型之间的中间和最终表示。在GPT-NeoX和Qwen2.5的语言建模和常识推理任务上,AdaDSF显著减少了推理FLOPs,同时保持接近密集模型的性能。

🔬 方法详解

问题定义:本文旨在解决现有大语言模型推理成本高的问题,现有方法往往需要针对特定任务的微调或从头训练,导致适应成本高且跨任务可用性差。

核心思路:论文提出的AdaDSF框架利用层之间的余弦相似度来评估不同层对表示转换的贡献,从而动态调整每层的令牌保留比例,以实现深度稀疏化。

技术框架:AdaDSF的整体架构包括三个主要模块:首先,通过计算层输入和输出的余弦相似度来获取相似性统计;其次,基于这些统计信息分配层级令牌保留比例;最后,使用轻量级路由器选择信息性令牌,并引入特征保持对齐目标以匹配稀疏和密集模型的表示。

关键创新:最重要的创新在于通过层输入和输出的相似性来动态调整令牌保留比例,这一方法与传统的静态稀疏化方法有本质区别。

关键设计:在设计中,AdaDSF使用轻量级路由器来选择令牌,并引入特征保持对齐损失函数,以确保稀疏模型与密集模型之间的表示一致性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,AdaDSF在GPT-NeoX和Qwen2.5上显著减少了推理FLOPs,而性能保持接近密集模型。在相同稀疏度下,AdaDSF的准确度下降幅度小于包括MoD、D-LLM和DLO在内的强基线方法。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和智能问答等。通过降低推理成本,AdaDSF可以使大语言模型在资源受限的环境中更具可用性,推动其在实际应用中的广泛部署。

📄 摘要(原文)

Large language models (LLMs) achieve strong generation and reasoning performance, but the Transformer architecture incurs high inference cost. Existing acceleration methods often rely on task-specific fine-tuning or training from scratch, increasing adaptation cost and limiting cross-task usability. We present an Adaptive Depth Sparse Framework (AdaDSF) that converts off-the-shelf pre-trained LLMs into depth-sparse models without full retraining. Our key insight is that layers contribute unequally to representation transformation, characterized by the cosine similarity between layer input and output hidden states. Based on this, AdaDSF assigns layer-wise token retention ratios from similarity statistics, uses a lightweight router to select informative tokens at each layer, and introduces a feature-preserving alignment objective to match intermediate and final representations between sparse and dense models. On GPT-NeoX and Qwen2.5 over language modeling and commonsense reasoning, AdaDSF substantially reduces inference FLOPs while preserving performance close to dense counterparts. Under comparable sparsity, AdaDSF consistently yields smaller accuracy degradation than strong baselines including MoD, D-LLM, and DLO.