Open-Set Image Tagging with Multi-Grained Text Supervision
作者: Xinyu Huang, Yi-Jie Huang, Youcai Zhang, Weiwei Tian, Rui Feng, Yuejie Zhang, Yanchun Xie, Yaqian Li, Lei Zhang
分类: cs.CV
发布日期: 2023-10-23 (更新: 2023-11-16)
备注: Homepage: https://github.com/xinyu1205/recognize-anything
🔗 代码/项目: GITHUB
💡 一句话要点
提出RAM++模型以解决开放集图像标记问题
🎯 匹配领域: 支柱五:交互与反应 (Interaction & Reaction) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放集图像标记 多粒度文本监督 大型语言模型 图像识别 语义标签识别
📋 核心要点
- 现有方法如CLIP在开放集图像标记中主要依赖全局文本监督,导致在识别多个语义标签时效果不佳。
- RAM++模型通过整合个别标签监督与全局文本监督,提升了对预定义标签和开放集类别的识别能力。
- 在OpenImages和ImageNet上,RAM++在预定义标签类别上分别比CLIP提升了10.2 mAP和15.4 mAP,显示出显著的性能改进。
📝 摘要(中文)
本文介绍了一种开放集图像标记模型——Recognize Anything Plus Model (RAM++),该模型有效利用多粒度文本监督。以往方法(如CLIP)主要依赖全局文本监督与图像配对,导致在识别多个单独语义标签时表现不佳。相较之下,RAM++在统一对齐框架内无缝整合了个别标签监督与全局文本监督。这种整合不仅确保了对预定义标签类别的高效识别,还增强了对多样化开放集类别的泛化能力。此外,RAM++利用大型语言模型将语义约束的标签监督转化为更广泛的标签描述监督,从而丰富了开放集视觉描述概念的范围。综合评估表明,RAM++在多个图像识别基准上超越了现有的最先进开放集图像标记模型。
🔬 方法详解
问题定义:本文旨在解决开放集图像标记中的标签识别不足问题,现有方法如CLIP在处理多个语义标签时表现不佳,无法有效利用个别标签信息。
核心思路:RAM++模型通过将个别标签监督与全局文本监督结合,形成统一的对齐框架,从而提高了对多样化标签的识别能力。
技术框架:RAM++的整体架构包括多个模块,首先通过全局文本监督获取图像的整体语义信息,然后通过个别标签监督进行细粒度的标签识别,最后利用大型语言模型扩展标签描述的范围。
关键创新:RAM++的主要创新在于其无缝整合个别与全局标签监督的能力,这一设计使得模型在开放集场景中具备更强的泛化能力,与传统方法相比,能够更好地处理未见类别。
关键设计:在模型设计中,采用了特定的损失函数以平衡个别与全局监督的影响,同时在网络结构上引入了大型语言模型,以增强标签描述的丰富性。具体的参数设置和网络结构细节在论文中有详细说明。
🖼️ 关键图片
📊 实验亮点
RAM++在多个基准测试中表现优异,尤其是在OpenImages和ImageNet上,分别比CLIP提升了10.2 mAP和15.4 mAP。在开放集类别上,RAM++比CLIP和RAM分别提升了5.0 mAP和6.4 mAP,显示出其在多样化人机交互短语上的显著改进。
🎯 应用场景
该研究的潜在应用领域包括图像搜索、社交媒体内容标记、自动化图像分类等。通过提升开放集图像标记的准确性,RAM++能够为多种视觉任务提供更强的支持,未来可能在智能监控、自动驾驶等领域产生深远影响。
📄 摘要(原文)
In this paper, we introduce the Recognize Anything Plus Model (RAM++), an open-set image tagging model effectively leveraging multi-grained text supervision. Previous approaches (e.g., CLIP) primarily utilize global text supervision paired with images, leading to sub-optimal performance in recognizing multiple individual semantic tags. In contrast, RAM++ seamlessly integrates individual tag supervision with global text supervision, all within a unified alignment framework. This integration not only ensures efficient recognition of predefined tag categories, but also enhances generalization capabilities for diverse open-set categories. Furthermore, RAM++ employs large language models (LLMs) to convert semantically constrained tag supervision into more expansive tag description supervision, thereby enriching the scope of open-set visual description concepts. Comprehensive evaluations on various image recognition benchmarks demonstrate RAM++ exceeds existing state-of-the-art (SOTA) open-set image tagging models on most aspects. Specifically, for predefined commonly used tag categories, RAM++ showcases 10.2 mAP and 15.4 mAP enhancements over CLIP on OpenImages and ImageNet. For open-set categories beyond predefined, RAM++ records improvements of 5.0 mAP and 6.4 mAP over CLIP and RAM respectively on OpenImages. For diverse human-object interaction phrases, RAM++ achieves 7.8 mAP and 4.7 mAP improvements on the HICO benchmark. Code, datasets and pre-trained models are available at \url{https://github.com/xinyu1205/recognize-anything}.