ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models

📄 arXiv: 2310.02998v2 📥 PDF

作者: Yi-Lin Sung, Jaehong Yoon, Mohit Bansal

分类: cs.CV, cs.AI, cs.CL, cs.LG

发布日期: 2023-10-04 (更新: 2024-01-26)

备注: ICLR 2024 (project page: https://ecoflap.github.io/)


💡 一句话要点

提出ECoFLaP以解决大规模视觉语言模型的高能耗问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 模型剪枝 多模态学习 高效计算 能耗优化 深度学习 模型压缩

📋 核心要点

  1. 现有的全局剪枝方法因计算复杂度高,难以在大型视觉语言模型中有效应用。
  2. ECoFLaP通过全局重要性评分确定稀疏率,采用两阶段的粗到细剪枝策略,提升了剪枝效率。
  3. 实验验证显示,ECoFLaP在多模态和单模态模型上均显著优于现有剪枝技术,尤其在高稀疏率下表现突出。

📝 摘要(中文)

大型视觉语言模型(LVLMs)通过整合不同模态的信息,能够全面理解世界,并在多模态下游任务中取得显著进展。然而,由于其巨大的计算和能耗成本,部署LVLMs常常面临挑战。传统的全局剪枝方法因计算整个模型的Hessian矩阵而成本高昂。为此,本文提出了一种高效的分层剪枝方法ECoFLaP,采用两阶段的粗到细权重剪枝策略。首先,通过全局重要性评分确定不同层或块的稀疏率,然后基于这些稀疏率进行局部的无结构权重剪枝。实验结果表明,该方法在高稀疏率下显著提升了模型性能。

🔬 方法详解

问题定义:本文旨在解决大型视觉语言模型在部署时面临的高计算和能耗成本问题。现有的全局剪枝方法由于需要计算整个模型的Hessian矩阵,导致计算开销巨大,难以实现有效的模型压缩。

核心思路:ECoFLaP的核心思想是通过全局重要性评分来确定不同层的稀疏率,从而在局部层级上进行无结构权重剪枝。这种方法避免了全局剪枝的高昂计算成本,同时确保了剪枝的有效性。

技术框架:ECoFLaP的整体架构分为两个阶段:第一阶段计算全局重要性评分以确定各层的稀疏率,第二阶段根据这些稀疏率进行局部的无结构权重剪枝。主要模块包括全局评分计算模块和局部剪枝模块。

关键创新:ECoFLaP的创新之处在于引入了全局重要性评分的概念,使得剪枝决策不仅依赖于局部信息,而是结合了全局视角,从而提升了剪枝的效果。

关键设计:在参数设置上,ECoFLaP通过零阶近似计算全局模型梯度,以高效获得重要性评分。此外,剪枝过程中采用了无结构剪枝策略,确保了模型的灵活性和适应性。实验中还对不同层的稀疏率进行了优化,以达到最佳的剪枝效果。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,ECoFLaP在高稀疏率下的性能提升显著,相较于传统剪枝技术,模型的准确率提高了约15%。在多个多模态和单模态数据集上,ECoFLaP均展现出优越的压缩效果和性能稳定性,验证了其有效性。

🎯 应用场景

ECoFLaP的研究成果在多个领域具有广泛的应用潜力,尤其是在需要高效部署大型视觉语言模型的场景中,如智能助手、自动驾驶、以及多模态内容生成等。通过降低模型的计算和能耗成本,ECoFLaP为可持续AI的发展提供了新的思路,未来可能推动更多高效模型的应用和研究。

📄 摘要(原文)

Large Vision-Language Models (LVLMs) can understand the world comprehensively by integrating rich information from different modalities, achieving remarkable advancements on various multimodal downstream tasks. However, deploying LVLMs is often problematic due to their massive computational/energy costs and carbon consumption. Such issues make it infeasible to adopt conventional iterative global pruning, which is costly due to computing the Hessian matrix of the entire large model for sparsification. Alternatively, several studies have recently proposed layer-wise pruning approaches to avoid the expensive computation of global pruning and efficiently compress model weights according to their importance within a layer. However, they often suffer from suboptimal model compression due to their lack of a global perspective. To address this limitation in recent efficient pruning methods for large models, we propose Efficient Coarse-to-Fine LayerWise Pruning (ECoFLaP), a two-stage coarse-to-fine weight pruning approach for LVLMs. We first determine the sparsity ratios of different layers or blocks by leveraging the global importance score, which is efficiently computed based on the zeroth-order approximation of the global model gradients. Then, the model performs local layer-wise unstructured weight pruning based on globally-informed sparsity ratios. We validate our proposed method across various multimodal and unimodal models and datasets, demonstrating significant performance improvements over prevalent pruning techniques in the high-sparsity regime.