Sparse Attention for Dense Open-Vocabulary Prediction in CLIP

📄 arXiv: 2607.07135v1 📥 PDF

作者: Fatimah Zohra, Chen Zhao, Shuming Liu, Bernard Ghanem

分类: cs.CV

发布日期: 2026-07-08


💡 一句话要点

提出稀疏注意力机制以解决CLIP中的密集开放词汇预测问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 稀疏注意力 开放词汇预测 对比学习 视觉自注意力 多模态学习

📋 核心要点

  1. 现有的CLIP方法在密集开放词汇预测中存在注意力分散的问题,导致低显著性标记产生噪声,影响精确度。
  2. 本文提出在推理阶段用α-entmax变换替代softmax,以实现稀疏注意力,增强对相关标记的关注。
  3. 实验结果表明,注意力稀疏化显著提升了在密集语义分割和细粒度检索任务中的性能,尤其是在目标类分散较大的情况下。

📝 摘要(中文)

对比语言-图像预训练(CLIP)依赖于基于softmax的自注意力机制,这种机制为每对标记分配概率质量,导致注意力分散在许多低显著性标记上。本文研究在推理阶段用α-entmax变换替代最终视觉自注意力层中的行softmax,从而作为隐式去噪器,消除上下文无关的依赖关系。我们在开放词汇任务上进行评估,发现注意力稀疏化的增益与基线注意力在目标类上的分散程度成正比。

🔬 方法详解

问题定义:本文旨在解决CLIP模型在密集开放词汇预测中由于softmax注意力机制导致的低显著性标记噪声问题。现有方法在预训练阶段虽然能广泛收集上下文信息,但在推理时却分散了注意力,影响了对重要信息的捕捉。

核心思路:论文提出在推理阶段用α-entmax变换替代softmax,以实现稀疏注意力。该方法通过数据依赖的阈值将低分数映射为零,从而消除无关依赖,同时将注意力重新分配到最相关的标记上。

技术框架:整体架构包括标准查询-键注意力和自相关变体,主要模块为视觉自注意力层,采用α-entmax变换替代传统的softmax。

关键创新:最重要的创新在于引入了α-entmax变换作为隐式去噪器,显著提高了对目标类的关注度,解决了传统softmax在推理时的注意力分散问题。

关键设计:在模型设计中,α-entmax的参数设置和损失函数经过精心调整,以确保在不同任务中都能有效提升性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,采用稀疏注意力机制后,在Pascal VOC、Pascal Context和ADE20K等数据集上的密集语义分割任务中,模型性能显著提升,尤其是在目标类分散较大的情况下,注意力稀疏化的增益与基线注意力的分散程度成正比。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉中的密集语义分割和细粒度检索等任务,能够有效提升模型在开放词汇场景下的表现。未来,该方法可能推动更高效的多模态学习和推理技术的发展,增强AI系统在复杂场景中的理解能力。

📄 摘要(原文)

Contrastive Language-Image Pre-training (CLIP) relies on softmax-based self-attention, a strictly positive distribution that assigns probability mass to every pair of tokens-even semantically irrelevant ones. While these dense softmax weights are effective for gathering broad context during pre-training, they spread attention across many low-salience tokens, producing noise that obscures the fine-grained, spatially localized cues required for dense, open-vocabulary prediction. We study an inference-time substitution of the row-wise softmax in the final visual self-attention layers with the $α$-entmax transform, applied across both the standard query-key attention and self-correlation variants. Because entmax applies a data-dependent threshold that maps low scores exactly to zero, it acts as an implicit denoiser, zeroing contextually irrelevant dependencies while redistributing mass onto the most relevant tokens. We evaluate on open-vocabulary tasks-dense semantic segmentation (Pascal VOC, Pascal Context, ADE20K) and fine-grained retrieval (FG-OVD)-and find the gain from attention sparsification is proportional to how much the baseline attention spreads off the target class.