ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models

📄 arXiv: 2310.04564v1 📥 PDF

作者: Iman Mirzadeh, Keivan Alizadeh, Sachin Mehta, Carlo C Del Mundo, Oncel Tuzel, Golnoosh Samei, Mohammad Rastegari, Mehrdad Farajtabar

分类: cs.LG, cs.AI

发布日期: 2023-10-06

备注: preprint


💡 一句话要点

提出ReLU激活以解决大语言模型推理效率问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 ReLU激活 推理效率 计算优化 稀疏性模式

📋 核心要点

  1. 现有大型语言模型在推理时计算需求高,导致在资源受限设备上部署困难。
  2. 本文提出重新使用ReLU激活函数,强调其在计算效率上的优势,同时保持模型性能。
  3. 实验结果显示,采用ReLU激活后,推理计算量可减少至三倍,且性能损失极小。

📝 摘要(中文)

大型语言模型(LLMs)在人工智能应用中发挥了重要作用,但其推理过程中的高计算需求对资源受限设备的部署带来了挑战。尽管近期有研究倾向于使用GELU或SiLU等替代激活函数,本文却主张在LLMs中重新采用ReLU激活函数。研究表明,使用ReLU激活对收敛和性能的影响微乎其微,同时显著降低了计算和权重传输的需求,尤其在内存受限的推理步骤中,效率至关重要。通过探索ReLU基础LLMs中的稀疏性模式,本文提出了实用策略,能够将LLM推理计算减少至三倍,同时保持性能的最小损失。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在推理过程中的高计算需求问题,现有方法如GELU和SiLU虽然提高了性能,但计算开销显著,限制了在资源受限设备上的应用。

核心思路:论文提出重新采用ReLU激活函数,认为其在保持模型收敛性和性能的同时,能够显著降低计算和权重传输的需求,尤其在内存受限的推理阶段。

技术框架:研究通过分析ReLU激活的稀疏性模式,提出了一种新的推理策略,主要包括激活神经元的重用和新标记生成的优化。

关键创新:最重要的创新在于揭示了ReLU激活函数在大型语言模型中的有效性,尤其是在推理效率上的提升,显著区别于当前流行的激活函数选择。

关键设计:在实验中,采用了特定的参数设置和损失函数,确保了在使用ReLU激活时,模型的收敛性和性能保持在可接受范围内,同时优化了内存使用和计算效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,使用ReLU激活函数后,推理计算量减少至三倍,且与基线模型相比,性能损失极小。这一发现为大型语言模型的高效部署提供了新的思路和方法。

🎯 应用场景

该研究的潜在应用领域包括移动设备上的自然语言处理、实时语音识别和其他需要高效推理的AI应用。通过降低计算需求,能够使大型语言模型在更广泛的设备上部署,提升用户体验和应用普及率。

📄 摘要(原文)

Large Language Models (LLMs) with billions of parameters have drastically transformed AI applications. However, their demanding computation during inference has raised significant challenges for deployment on resource-constrained devices. Despite recent trends favoring alternative activation functions such as GELU or SiLU, known for increased computation, this study strongly advocates for reinstating ReLU activation in LLMs. We demonstrate that using the ReLU activation function has a negligible impact on convergence and performance while significantly reducing computation and weight transfer. This reduction is particularly valuable during the memory-bound inference step, where efficiency is paramount. Exploring sparsity patterns in ReLU-based LLMs, we unveil the reutilization of activated neurons for generating new tokens and leveraging these insights, we propose practical strategies to substantially reduce LLM inference computation up to three times, using ReLU activations with minimal performance trade-offs.