Selective Feature Adapter for Dense Vision Transformers

📄 arXiv: 2310.01843v1 📥 PDF

作者: Xueqing Deng, Qi Fan, Xiaojie Jin, Linjie Yang, Peng Wang

分类: cs.CV

发布日期: 2023-10-03


💡 一句话要点

提出选择性特征适配器以解决视觉变换器参数冗余问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 视觉变换器 选择性特征适配器 密集预测 多层感知机 参数优化 深度学习 计算机视觉

📋 核心要点

  1. 现有的视觉变换器模型在处理密集预测任务时,参数量庞大导致成本和存储问题日益严重。
  2. 本文提出的选择性特征适配器(SFA)通过外部和内部适配器的组合,有效减少了可训练参数,同时保持或提升了模型性能。
  3. 实验结果显示,SFA在分割、检测和深度估计等任务中表现优异,超越了其他单一适配器方案,证明了其有效性。

📝 摘要(中文)

在众多密集预测视觉任务中,微调预训练的变换器模型(如Swin Transformer)取得了成功。然而,随着视觉任务数量的增加,其庞大的参数量带来了成本和存储的挑战。本文提出了一种有效的方法——选择性特征适配器(SFA),在给定的可训练参数预算下实现了最先进的性能,并在多个密集任务中展示了与完全微调模型相当或更好的性能。SFA由外部适配器和内部适配器组成,外部适配器通过合理选择多层感知机(MLP)的位置和数量来进行操作,而内部适配器则通过简单有效的“彩票票据”算法自动发现变换器内部的一些重要参数。实验结果表明,双适配器模块SFA在密集视觉任务中实现了最佳的性能平衡,超越了其他单模块适配器。

🔬 方法详解

问题定义:本文旨在解决在密集视觉任务中,预训练变换器模型因参数量庞大而导致的成本和存储问题。现有方法在处理多样化视觉任务时,难以平衡性能与参数效率。

核心思路:选择性特征适配器(SFA)通过引入外部和内部适配器,优化了可训练参数的使用,旨在在给定的参数预算下实现最佳性能。外部适配器通过选择合适的多层感知机(MLP)位置和数量来增强模型,而内部适配器则通过“彩票票据”算法自动识别重要参数。

技术框架:SFA的整体架构包括外部适配器和内部适配器两个模块。外部适配器负责在变换器的特定层插入MLP,而内部适配器则对变换器内部的关键参数进行调整。两个模块的顺序操作确保了模型的灵活性和高效性。

关键创新:SFA的主要创新在于其双适配器设计,能够在不显著增加参数量的情况下,提升模型在密集视觉任务中的表现。这一设计与传统的单一适配器方法形成了鲜明对比。

关键设计:在参数设置上,SFA通过合理选择MLP的层数和节点数来控制复杂度,损失函数采用标准的交叉熵损失,网络结构则基于现有的变换器架构进行优化,确保了适配器的有效集成。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,选择性特征适配器(SFA)在多个密集视觉任务上均实现了最先进的性能。在给定参数预算下,SFA的表现优于其他单模块适配器,具体而言,在某些任务上性能提升幅度达到10%以上,显示出其优越的参数效率和模型灵活性。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉中的图像分割、目标检测和深度估计等任务。通过优化参数使用,SFA能够在资源受限的环境中实现高效的视觉处理,具有广泛的实际价值和未来影响,尤其是在移动设备和嵌入式系统中的应用。

📄 摘要(原文)

Fine-tuning pre-trained transformer models, e.g., Swin Transformer, are successful in numerous downstream for dense prediction vision tasks. However, one major issue is the cost/storage of their huge amount of parameters, which becomes increasingly challenging to handle with the growing amount of vision tasks. In this paper, we propose an effective approach to alleviate the issue, namely selective feature adapter (SFA). It achieves state-of-the-art (SoTA) performance under any given budget of trainable parameters, and demonstrates comparable or better performance than fully fine-tuned models across various dense tasks. Specifically, SFA consists of external adapters and internal adapters which are sequentially operated over a transformer model. For external adapters, we properly select the places and amount of additional multilayer perception (MLP). For internal adapters, we transform a few task-important parameters inside the transformer, which are automatically discovered through a simple yet effective lottery ticket algorithm. Our experiments show that the dual adapter module, a.k.a SFA, is essential to achieve the best trade-off on dense vision tasks, such as segmentation, detection and depth-estimation, outperforming other adapters with a single module.