Intra-Modal Proxy Learning for Zero-Shot Visual Categorization with CLIP

📄 arXiv: 2310.19752v1 📥 PDF

作者: Qi Qian, Yuanhong Xu, Juhua Hu

分类: cs.CV, cs.LG

发布日期: 2023-10-30

备注: accepted by NeurIPS'23

🔗 代码/项目: GITHUB


💡 一句话要点

提出InMaP以解决视觉分类中的模态差距问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 零样本学习 视觉分类 模态差距 CLIP 内部代理学习 计算机视觉 文本嵌入 视觉嵌入

📋 核心要点

  1. 现有的视觉语言预训练方法在处理文本和视觉模态之间的差距时存在不足,导致零样本分类性能不佳。
  2. 本文提出了一种新的方法,通过直接在视觉空间中学习视觉代理,并利用文本代理进行辅助,以实现更好的零样本迁移。
  3. 实验结果表明,InMaP方法在ImageNet数据集上将零样本准确率从77.02%提升至80.21%,且在单个GPU上仅需一分钟即可完成视觉代理的学习。

📝 摘要(中文)

视觉语言预训练方法(如CLIP)在零样本视觉分类中表现出色,但文本和视觉空间之间的模态差距可能导致性能不佳。本文理论上证明,仅通过最小化对比损失无法充分缩小这一差距,视觉任务的最佳代理可能仅存在于视觉空间。因此,针对未标记的目标视觉数据,提出直接利用文本代理学习视觉代理的方法,以实现零样本迁移。此外,根据理论分析,开发了策略进一步优化通过文本代理获得的伪标签,以促进视觉的内部代理学习(InMaP)。在大量下游任务上的实验验证了该方法的有效性和高效性。具体而言,InMaP能够在单个GPU上在一分钟内获得视觉代理,同时在ImageNet上将零样本准确率从77.02%提升至80.21%。代码可在https://github.com/idstcv/InMaP获取。

🔬 方法详解

问题定义:本文旨在解决视觉分类中由于文本和视觉模态之间的差距导致的性能不足问题。现有方法主要依赖于对比损失来缩小这一差距,但效果有限。

核心思路:提出通过直接在视觉空间中学习视觉代理,结合文本代理的辅助信息,以实现更有效的零样本迁移。这种方法旨在克服模态间的差距,从而提高分类准确性。

技术框架:整体架构包括两个主要模块:文本代理模块和视觉代理模块。文本代理模块负责生成文本嵌入,而视觉代理模块则通过学习未标记的视觉数据来生成视觉嵌入。两个模块通过优化策略相互配合。

关键创新:最重要的创新点在于提出了内部代理学习(InMaP)策略,通过优化文本代理生成的伪标签来直接学习视觉代理。这一方法与传统的依赖对比损失的方式有本质区别。

关键设计:在设计中,采用了特定的损失函数来优化伪标签,并通过调整网络结构以适应视觉代理的学习需求。具体参数设置和网络架构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
img_1

📊 实验亮点

实验结果显示,InMaP方法在ImageNet数据集上将零样本准确率从77.02%提升至80.21%,提升幅度达到3.19%。此外,该方法在单个GPU上仅需一分钟即可完成视觉代理的学习,展现出高效性与实用性。

🎯 应用场景

该研究具有广泛的应用潜力,尤其是在需要进行零样本学习的计算机视觉任务中,如图像分类、物体检测等。通过提高视觉分类的准确性,该方法可以在自动驾驶、智能监控等领域发挥重要作用,推动相关技术的进步与应用。

📄 摘要(原文)

Vision-language pre-training methods, e.g., CLIP, demonstrate an impressive zero-shot performance on visual categorizations with the class proxy from the text embedding of the class name. However, the modality gap between the text and vision space can result in a sub-optimal performance. We theoretically show that the gap cannot be reduced sufficiently by minimizing the contrastive loss in CLIP and the optimal proxy for vision tasks may reside only in the vision space. Therefore, given unlabeled target vision data, we propose to learn the vision proxy directly with the help from the text proxy for zero-shot transfer. Moreover, according to our theoretical analysis, strategies are developed to further refine the pseudo label obtained by the text proxy to facilitate the intra-modal proxy learning (InMaP) for vision. Experiments on extensive downstream tasks confirm the effectiveness and efficiency of our proposal. Concretely, InMaP can obtain the vision proxy within one minute on a single GPU while improving the zero-shot accuracy from $77.02\%$ to $80.21\%$ on ImageNet with ViT-L/14@336 pre-trained by CLIP. Code is available at \url{https://github.com/idstcv/InMaP}.