Top-K Pooling with Patch Contrastive Learning for Weakly-Supervised Semantic Segmentation

📄 arXiv: 2310.09828v2 📥 PDF

作者: Wangyu Wu, Tianhong Dai, Xiaowei Huang, Fei Ma, Jimin Xiao

分类: cs.CV

发布日期: 2023-10-15 (更新: 2023-12-27)


💡 一句话要点

提出Top-K池化与补丁对比学习以解决弱监督语义分割问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 弱监督学习 语义分割 视觉变换器 补丁对比学习 伪标签生成

📋 核心要点

  1. 现有的ViT基础WSSS方法依赖最大池化选择补丁,可能导致伪标签质量下降。
  2. 本文提出TKP-PCL方法,通过Top-K池化和补丁对比学习来提升伪标签生成的准确性。
  3. 实验结果显示,TKP-PCL在PASCAL VOC 2012数据集上显著优于其他WSSS方法,验证了其有效性。

📝 摘要(中文)

弱监督语义分割(WSSS)仅使用图像级标签,因其成本效益而受到广泛关注。最近,基于视觉变换器(ViT)的方法在生成可靠的伪标签方面表现优于传统的类激活图(CAM)方法。然而,现有的ViT方法使用最大池化选择预测分数最高的补丁,这可能影响伪标签的质量。本文提出了一种新颖的ViT基础WSSS方法,称为Top-K池化与补丁对比学习(TKP-PCL),通过引入Top-K池化层来缓解最大池化选择的局限性,并提出补丁对比误差(PCE)以增强补丁嵌入,从而进一步改善最终结果。实验结果表明,该方法在PASCAL VOC 2012数据集上表现出色,优于其他最先进的WSSS方法。

🔬 方法详解

问题定义:本文旨在解决弱监督语义分割中伪标签生成的准确性问题。现有ViT方法使用最大池化选择补丁,可能导致错误分类,从而影响伪标签的质量。

核心思路:提出Top-K池化层替代最大池化,以选择多个高预测分数的补丁,结合补丁对比学习(PCE)来增强补丁嵌入,从而提高伪标签的生成效果。

技术框架:整体架构包括输入图像经过ViT进行特征提取,接着通过Top-K池化层选择补丁,最后利用补丁对比学习优化补丁嵌入,最终生成伪标签。

关键创新:最重要的创新在于引入Top-K池化层和补丁对比误差(PCE),这与传统的最大池化方法本质上不同,能够更全面地利用补丁信息。

关键设计:在设计中,Top-K池化层的参数设置允许选择多个补丁,而PCE损失函数则通过对比学习增强补丁的特征表示,确保生成的伪标签更为准确。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,TKP-PCL方法在PASCAL VOC 2012数据集上取得了显著的性能提升,相较于其他最先进的WSSS方法,准确率提高了X%(具体数据待补充),验证了其有效性和优越性。

🎯 应用场景

该研究在弱监督语义分割领域具有广泛的应用潜力,特别是在需要高效标注的场景中,如医学影像分析、自动驾驶和视频监控等。通过提升伪标签的质量,能够显著提高模型的整体性能,推动相关领域的进一步发展。

📄 摘要(原文)

Weakly Supervised Semantic Segmentation (WSSS) using only image-level labels has gained significant attention due to cost-effectiveness. Recently, Vision Transformer (ViT) based methods without class activation map (CAM) have shown greater capability in generating reliable pseudo labels than previous methods using CAM. However, the current ViT-based methods utilize max pooling to select the patch with the highest prediction score to map the patch-level classification to the image-level one, which may affect the quality of pseudo labels due to the inaccurate classification of the patches. In this paper, we introduce a novel ViT-based WSSS method named top-K pooling with patch contrastive learning (TKP-PCL), which employs a top-K pooling layer to alleviate the limitations of previous max pooling selection. A patch contrastive error (PCE) is also proposed to enhance the patch embeddings to further improve the final results. The experimental results show that our approach is very efficient and outperforms other state-of-the-art WSSS methods on the PASCAL VOC 2012 dataset.