Representation Learning via Consistent Assignment of Views over Random Partitions

📄 arXiv: 2310.12692v2 📥 PDF

作者: Thalles Silva, Adín Ramírez Rivera

分类: cs.CV, cs.LG

发布日期: 2023-10-19 (更新: 2023-10-27)

备注: To appear in NeurIPS 2023. Code available at https://github.com/sthalles/carp


💡 一句话要点

提出CARP方法以解决自监督聚类中的一致性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 自监督学习 聚类方法 表示学习 计算机视觉 随机划分

📋 核心要点

  1. 现有自监督聚类方法在聚类分配一致性和训练稳定性方面存在不足,容易导致模型崩溃。
  2. CARP方法通过随机划分原型优化预训练任务,增强视图分配一致性,避免了非可微模块的使用。
  3. 在17个数据集上进行的评估显示,CARP在多个下游任务中表现优异,且在迁移学习任务中平均性能最佳。

📝 摘要(中文)

我们提出了一种自监督聚类方法——随机划分视图的一致分配(CARP),用于视觉特征的表示学习。CARP通过梯度下降以端到端的在线方式学习原型,无需额外的非可微模块来解决聚类分配问题。该方法基于原型的随机划分优化了一项新的预训练任务,正则化模型并强化视图分配的一致性。此外,CARP提高了训练的稳定性,防止了联合嵌入训练中的崩溃解决方案。通过广泛的评估,我们证明了CARP的表示适合用于下游任务,并在17个数据集上进行评估,比较了CARP与11种现有自监督方法的性能。

🔬 方法详解

问题定义:本论文旨在解决自监督聚类中的聚类分配一致性问题。现有方法通常依赖于非可微模块,导致训练不稳定和模型崩溃。

核心思路:CARP通过引入随机划分的预训练任务,增强了模型对视图分配的一致性,避免了传统方法中的一些限制。这样的设计使得模型能够在不依赖复杂模块的情况下进行有效的聚类。

技术框架:CARP的整体架构包括原型学习模块和随机划分任务模块。模型通过梯度下降进行在线学习,实时更新原型并进行聚类分配。

关键创新:CARP的主要创新在于引入随机划分的预训练任务,这一设计显著提高了学习表示的质量,并且与现有方法相比,避免了崩溃解决方案的出现。

关键设计:在损失函数设计上,CARP采用了正则化策略以增强模型的稳定性,并通过多种随机分类任务来提升学习效果。网络结构上,CARP保持了简单性,避免了复杂的非可微模块。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在实验中,CARP在17个数据集上进行了广泛评估,显示出在多个标准协议下的优越性能。与11种现有自监督方法相比,CARP在迁移学习任务中平均性能最佳,且在多个任务上显著提升了表示学习的质量。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉中的图像分类、目标检测和图像检索等任务。CARP方法的有效性和稳定性使其在实际应用中具有较高的价值,尤其是在数据稀缺的情况下,能够为下游任务提供高质量的特征表示。未来,CARP可能会影响自监督学习领域的进一步研究和应用。

📄 摘要(原文)

We present Consistent Assignment of Views over Random Partitions (CARP), a self-supervised clustering method for representation learning of visual features. CARP learns prototypes in an end-to-end online fashion using gradient descent without additional non-differentiable modules to solve the cluster assignment problem. CARP optimizes a new pretext task based on random partitions of prototypes that regularizes the model and enforces consistency between views' assignments. Additionally, our method improves training stability and prevents collapsed solutions in joint-embedding training. Through an extensive evaluation, we demonstrate that CARP's representations are suitable for learning downstream tasks. We evaluate CARP's representations capabilities in 17 datasets across many standard protocols, including linear evaluation, few-shot classification, k-NN, k-means, image retrieval, and copy detection. We compare CARP performance to 11 existing self-supervised methods. We extensively ablate our method and demonstrate that our proposed random partition pretext task improves the quality of the learned representations by devising multiple random classification tasks. In transfer learning tasks, CARP achieves the best performance on average against many SSL methods trained for a longer time.