Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models
作者: Bishmoy Paul, Youngmin Yi, Hoeseok Yang
分类: cs.LG, cs.CL
发布日期: 2026-07-09
💡 一句话要点
提出敏感度感知阈值和令牌路由以优化大语言模型的激活稀疏化
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 激活稀疏化 敏感度感知 令牌路由 计算效率 模型优化 深度学习
📋 核心要点
- 现有方法在大语言模型推理中面临计算效率与模型质量之间的权衡挑战。
- 论文提出敏感度感知阈值稀疏化(SATS)和动态令牌路由,以优化激活稀疏化和计算路径选择。
- 实验结果显示,SATS在相同稀疏度下优于传统方法,令牌路由在质量与吞吐量的平衡上表现更佳。
📝 摘要(中文)
在大语言模型(LLMs)的高效推理中,如何在保持模型质量的同时减少计算量是一个重要问题。本文通过多层感知器(MLP)激活稀疏化和令牌级条件路由来研究这一问题。我们首先提出了敏感度感知阈值稀疏化(SATS),该方法通过局部MLP输出敏感度代理来选择层级门阈值,而不是直接从激活百分位数进行阈值校准。接着,我们引入了一种轻量级的令牌路由框架,动态选择基础路径和修改路径,而不是对所有令牌统一应用修改计算。实验结果表明,SATS在匹配实际稀疏度的情况下优于基于阈值的稀疏化基线,而令牌路由在质量与吞吐量的权衡上优于静态激活修改基线。整体结果表明,改进的阈值校准和令牌路由可以提升LLMs的质量与吞吐量的权衡。
🔬 方法详解
问题定义:本文旨在解决大语言模型推理中的计算效率问题,现有方法在稀疏化激活时往往依赖于固定的阈值,导致计算资源的浪费和模型性能的下降。
核心思路:提出敏感度感知阈值稀疏化(SATS),通过局部MLP输出的敏感度来动态调整阈值,从而更有效地选择激活的稀疏化策略。同时,采用令牌级动态路由,允许模型根据每个令牌的特性选择最优计算路径。
技术框架:整体框架包括两个主要模块:一是SATS模块,通过敏感度分析确定每层的门阈值;二是令牌路由模块,根据每个令牌的特征动态选择基础路径或修改路径。
关键创新:最重要的创新在于使用敏感度代理进行阈值校准,取代了传统的基于百分位数的校准方法,使得稀疏化过程更加灵活和高效。
关键设计:在SATS中,阈值的选择依赖于局部输出的敏感度,而令牌路由则通过轻量级的计算框架实现动态选择,确保了计算资源的高效利用。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SATS在相同的稀疏度条件下,相较于传统的阈值稀疏化方法提升了模型性能,而令牌路由在质量与吞吐量的权衡上表现出更优的效果,具体性能数据未详述,待进一步验证。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和文本生成等大语言模型相关任务。通过优化计算效率和模型性能,能够在资源受限的环境中实现更高效的推理,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Efficient inference in Large Language Models (LLMs) requires deciding where computation can be reduced while preserving model quality. We study this problem through multilayer perceptron (MLP) activation sparsification and token-level conditional routing. We first propose Sensitivity-Aware Thresholding for Sparsity (SATS), a threshold calibration method to choose layerwise gate thresholds using a local MLP output sensitivity proxy rather than calibrating thresholds directly from activation percentiles. While SATS retains the existing mechanism of sparsifying MLP activations by thresholding gate activations, it replaces percentile-based calibration with a sensitivity-aware selection rule. We then introduce a lightweight token routing framework that dynamically selects between a base path and a modified path on a per-token basis, rather than applying the modified computation uniformly to all tokens. We evaluate both methods on multiple recent open-weight LLMs. Our results show that SATS improves over the threshold-based sparsification baseline at matched actual sparsity and that token routing yields a more favorable quality-throughput trade-off than static activation modification baselines. Overall, our results suggest that improved threshold calibration and token routing can improve the quality-throughput trade-off in LLMs.