LP-OVOD: Open-Vocabulary Object Detection by Linear Probing
作者: Chau Pham, Truong Vu, Khoi Nguyen
分类: cs.CV
发布日期: 2023-10-26 (更新: 2024-06-02)
🔗 代码/项目: GITHUB
💡 一句话要点
提出LP-OVOD以解决开放词汇物体检测问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 开放词汇检测 物体检测 CLIP 深度学习 计算机视觉 线性分类器
📋 核心要点
- 开放词汇物体检测(OVOD)面临的核心问题是现有方法无法有效区分高质量和低质量的框提议,导致检测性能下降。
- 本文提出的LP-OVOD方法通过训练sigmoid线性分类器来识别和丢弃低质量框,从而提高检测精度。
- 实验结果显示,LP-OVOD在COCO数据集上取得了40.5的AP_novel,显著优于现有方法,验证了其有效性。
📝 摘要(中文)
本文针对开放词汇物体检测(OVOD)这一挑战性问题进行研究,要求物体检测器在测试图像中识别已见和未见的类别,而无需在训练中提供未见类别的标注样本。现有方法通常利用CLIP的文本-图像联合嵌入来将框提议分配给其最接近的文本标签,但存在低质量框(如过度覆盖和不足覆盖的物体框)与高质量框具有相同相似度分数的问题。为了解决这一问题,本文提出了一种新方法LP-OVOD,通过在与新文本相关的最佳区域提议中检索伪标签,训练一个sigmoid线性分类器来丢弃低质量框。实验结果表明,使用ResNet50作为主干网络,LP-OVOD在COCO数据集上实现了40.5的AP_novel,优于现有最先进的方法。
🔬 方法详解
问题定义:本文旨在解决开放词汇物体检测(OVOD)中的低质量框问题。现有方法依赖于CLIP的文本-图像嵌入,导致高质量和低质量框的相似度评分相同,从而影响检测效果。
核心思路:LP-OVOD的核心思路是通过训练一个sigmoid线性分类器,利用与新文本相关的最佳区域提议的伪标签来丢弃低质量框。这种设计旨在提高检测的准确性和鲁棒性。
技术框架:LP-OVOD的整体架构包括两个主要阶段:首先,使用CLIP生成文本-图像嵌入并获取框提议;其次,训练sigmoid线性分类器以识别和丢弃低质量框。
关键创新:LP-OVOD的关键创新在于引入了sigmoid线性分类器来处理低质量框问题,这与传统方法直接依赖相似度评分的方式有本质区别。
关键设计:在技术细节上,LP-OVOD使用了伪标签生成机制,并在训练过程中优化了分类器的损失函数,以确保高质量框的准确识别。
🖼️ 关键图片
📊 实验亮点
LP-OVOD在COCO数据集上的实验结果显示,AP_novel达到了40.5,显著优于现有最先进的方法,验证了其在开放词汇物体检测中的有效性和优势。
🎯 应用场景
该研究的潜在应用场景包括智能监控、自动驾驶、机器人视觉等领域,能够在没有标注数据的情况下有效识别新物体类别,提升系统的灵活性和适应性。未来,随着开放词汇检测技术的进步,可能会在更广泛的实际应用中发挥重要作用。
📄 摘要(原文)
This paper addresses the challenging problem of open-vocabulary object detection (OVOD) where an object detector must identify both seen and unseen classes in test images without labeled examples of the unseen classes in training. A typical approach for OVOD is to use joint text-image embeddings of CLIP to assign box proposals to their closest text label. However, this method has a critical issue: many low-quality boxes, such as over- and under-covered-object boxes, have the same similarity score as high-quality boxes since CLIP is not trained on exact object location information. To address this issue, we propose a novel method, LP-OVOD, that discards low-quality boxes by training a sigmoid linear classifier on pseudo labels retrieved from the top relevant region proposals to the novel text. Experimental results on COCO affirm the superior performance of our approach over the state of the art, achieving $\textbf{40.5}$ in $\text{AP}_{novel}$ using ResNet50 as the backbone and without external datasets or knowing novel classes during training. Our code will be available at https://github.com/VinAIResearch/LP-OVOD.