SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs

📄 arXiv: 2607.18081v1 📥 PDF

作者: Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin Wang

分类: cs.LG, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出SelectInfer以解决边缘设备上LLM推理效率问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 边缘计算 神经元优化 选择性加载 选择性计算 自然语言处理 模型压缩 推理效率

📋 核心要点

  1. 现有的LLM模型在边缘设备上部署时面临高计算和内存需求的挑战,传统的压缩方法往往影响模型性能。
  2. SelectInfer通过选择性加载和计算神经元,优化了LLM在边缘设备上的推理效率,降低了内存占用。
  3. 实验结果显示,SelectInfer在多个数据集上显著减少了内存和计算需求,同时保持了良好的任务性能。

📝 摘要(中文)

大型语言模型(LLMs)在自然语言处理任务中展现了卓越的能力,但其高计算和内存需求在资源受限的边缘设备上部署时面临重大挑战。现有的模型压缩和优化方法通常依赖于粗粒度的剪枝或量化,这可能会影响准确性或需要重新训练和微调。本文提出了SelectInfer,一个神经元级优化框架,通过选择性加载和计算神经元,实现了边缘设备上高效的LLM推理。SelectInfer通过离线LLM分析器分析并识别任务特定和通用神经元,实施了两个关键优化:选择性加载和选择性计算。多数据集评估表明,SelectInfer在保持任务性能的同时显著减少了内存占用和计算量,为在边缘设备上部署LLM提供了实用的解决方案。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在资源受限的边缘设备上推理时的高内存和计算需求问题。现有方法如粗粒度剪枝和量化,往往会导致模型性能下降或需要额外的训练过程。

核心思路:SelectInfer的核心思路是通过离线分析识别重要神经元,实施选择性加载和计算,从而在推理时只处理最相关的神经元,提升效率。

技术框架:SelectInfer的整体架构包括两个主要模块:离线LLM分析器和推理阶段。在离线阶段,分析器识别出任务特定和通用的神经元;在推理阶段,根据识别结果动态加载和计算神经元。

关键创新:SelectInfer的主要创新在于其神经元级的优化策略,通过选择性加载和计算,显著降低了内存占用和计算量,与传统的粗粒度方法形成鲜明对比。

关键设计:在设计中,SelectInfer使用了特定的参数设置来优化神经元的选择过程,并确保在推理时只计算最相关的神经元,从而提高了整体效率。具体的损失函数和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SelectInfer在多个数据集上实现了内存占用减少高达50%,计算需求降低约40%,同时保持了与基线模型相当的任务性能。这一显著提升展示了其在边缘设备上应用的可行性和有效性。

🎯 应用场景

SelectInfer的研究成果具有广泛的应用潜力,尤其是在移动设备、物联网和边缘计算等资源受限的环境中。通过优化LLM的推理效率,该框架能够支持更复杂的自然语言处理任务,为智能助手、实时翻译和个性化推荐等应用提供更高效的解决方案,推动AI技术的普及与应用。

📄 摘要(原文)

Large Language Models (LLMs) have demonstrated remarkable capabilities across a range of Natural Language Processing (NLP) tasks, but their high computational and memory demands pose significant challenges for deployment on resource-constrained edge devices. Existing approaches to model compression and optimization often rely on coarse-grained pruning or quantization, which can compromise accuracy or require re-training and fine-tuning. In this work, we introduce SelectInfer, a neuron-level optimization framework that enables efficient LLM inference on edge devices through selective neuron loading and computation. By profiling and identifying both task-specific and general-purpose neurons using an offline LLM profiler, SelectInfer implements two key optimizations: selective loading, which reduces memory footprint by selectively loading a subset of neurons that were identified to be most important during the offline stage, and selective computation, which dynamically computes only the most relevant neurons at runtime. Evaluation across multiple datasets shows that SelectInfer achieves significant reductions in memory footprint and computation while preserving task performance, making it a practical step towards enabling LLM deployment on edge devices