Sub-token ViT Embedding via Stochastic Resonance Transformers

📄 arXiv: 2310.03967v2 📥 PDF

作者: Dong Lao, Yangchao Wu, Tian Yu Liu, Alex Wong, Stefano Soatto

分类: cs.CV, cs.AI

发布日期: 2023-10-06 (更新: 2024-05-06)


💡 一句话要点

提出随机共振变换器以解决ViT空间细节缺失问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 视觉变换器 随机共振 细粒度推理 特征聚合 计算机视觉 深度学习 图像处理

📋 核心要点

  1. 现有ViT方法在空间细节上存在不足,导致特征图的空间量化过于粗糙,影响细粒度推理任务的表现。
  2. 本文提出了一种随机共振变换器(SRT),通过子标记空间变换和逆变换聚合特征,提升空间粒度。
  3. SRT在多个任务上表现出色,性能提升高达14.9%,且无需微调,展示了其广泛的适用性。

📝 摘要(中文)

视觉变换器(ViT)架构将图像表示为高维向量化标记的集合,每个标记对应一个矩形非重叠的图块。这种表示方法在嵌入维度与空间粒度之间进行权衡,导致语义丰富但空间量化粗糙的特征图。为了解决这一问题,本文提出了一种受“随机共振”启发的无训练方法,进行输入数据的子标记空间变换,并在应用逆变换后聚合生成的ViT特征。所提出的“随机共振变换器”(SRT)保留了原始表示的丰富语义信息,同时在更细粒度的空间域上进行定位,部分缓解了空间标记化的粗糙效果。SRT适用于任何ViT架构的任意层,在多个任务(包括分割、分类、深度估计等)上性能提升高达14.9%,且无需任何微调。

🔬 方法详解

问题定义:本文旨在解决视觉变换器(ViT)在图像表示中因空间标记化导致的细节缺失问题。现有方法在空间粒度与嵌入维度之间的权衡,使得特征图的空间信息较为粗糙,影响了细粒度推理的效果。

核心思路:论文提出的随机共振变换器(SRT)通过对输入数据进行子标记空间变换,结合逆变换后的特征聚合,旨在保留丰富的语义信息并提升空间细节的表现。该方法灵感来源于随机共振现象,强调在特征提取过程中引入随机性以增强信息的表达能力。

技术框架:SRT的整体架构包括输入数据的子标记空间变换模块、逆变换模块以及特征聚合模块。输入数据经过空间变换后,生成新的特征表示,随后通过逆变换恢复到原始空间,最后将不同变换结果的特征进行聚合,以获得更细粒度的特征图。

关键创新:SRT的核心创新在于引入了随机共振的概念,通过空间变换与逆变换的结合,显著提升了ViT在细粒度任务中的表现。这一方法与传统的微调方法不同,避免了对模型的额外训练需求。

关键设计:在设计中,SRT的参数设置包括变换的随机性程度、聚合策略等。损失函数的选择与特征聚合策略密切相关,确保了在不同任务中的适应性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,随机共振变换器(SRT)在多个任务上均实现了显著的性能提升,最高可达14.9%。与基线模型相比,SRT在分割、分类和深度估计等任务上均表现出色,验证了其有效性和广泛适用性。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉中的图像分割、分类和深度估计等任务。通过提升ViT在细粒度推理中的表现,SRT可广泛应用于自动驾驶、医疗影像分析和智能监控等实际场景,具有重要的实际价值和未来影响。

📄 摘要(原文)

Vision Transformer (ViT) architectures represent images as collections of high-dimensional vectorized tokens, each corresponding to a rectangular non-overlapping patch. This representation trades spatial granularity for embedding dimensionality, and results in semantically rich but spatially coarsely quantized feature maps. In order to retrieve spatial details beneficial to fine-grained inference tasks we propose a training-free method inspired by "stochastic resonance". Specifically, we perform sub-token spatial transformations to the input data, and aggregate the resulting ViT features after applying the inverse transformation. The resulting "Stochastic Resonance Transformer" (SRT) retains the rich semantic information of the original representation, but grounds it on a finer-scale spatial domain, partly mitigating the coarse effect of spatial tokenization. SRT is applicable across any layer of any ViT architecture, consistently boosting performance on several tasks including segmentation, classification, depth estimation, and others by up to 14.9% without the need for any fine-tuning.