Multimodal Semantic-Probabilistic Objectness for Open World Object Detection
作者: Weijun Tian, Rui Liu
分类: cs.CV, cs.AI
发布日期: 2026-07-27
备注: 16 pages, 3 figures, 4 tables
💡 一句话要点
提出MSPO框架以提升开放世界物体检测的准确性
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放世界物体检测 概率物体性 多模态融合 增量学习 语义校准
📋 核心要点
- 现有方法在开放世界物体检测中,无法有效区分已知类别与未知类别,导致决策边界模糊。
- 本文提出MSPO框架,通过引入已知类别的语言先验,增强了PROB的未知物体发现能力。
- 实验结果显示,MSPO在M-OWODB和S-OWODB数据集上提升了PASCAL VOC的mAP达2.7分,表现出色。
📝 摘要(中文)
开放世界物体检测(OWOD)要求检测器识别已知类别、发现未命名的未知类别物体,并逐步学习新标注的类别。PROB通过在解码器查询空间中建模类无关的概率物体性来改善未知物体的发现。然而,仅依靠视觉物体性无法明确区分已知实例、未知类别物体或背景杂乱,导致已知与未知的决策边界模糊。为此,本文提出了MSPO,一个轻量级的语义校准框架,通过任务感知的已知类别语言先验增强PROB,同时保持其检测器架构和增量学习协议。MSPO通过扩展文本描述来构建已知类别的语义支持,从而有效校准已知和未知的预测。实验结果表明,MSPO在主要指标上显著提升了PROB基线的性能,同时保持了竞争力的未知召回率。
🔬 方法详解
问题定义:本文旨在解决开放世界物体检测中已知类别与未知类别的模糊决策问题。现有方法PROB虽然能改善未知物体发现,但仅依赖视觉信息,无法有效区分已知实例与未知物体。
核心思路:MSPO框架通过引入任务感知的已知类别语言先验,增强了对已知类别的语义支持,从而提高了已知与未知物体的预测准确性。该设计旨在保留PROB的架构和增量学习能力,同时引入语义信息以改善决策边界。
技术框架:MSPO的整体架构包括三个主要模块:首先,为每个已知类别构建扩展的文本描述;其次,使用冻结的CLIP文本编码器对描述进行编码;最后,将解码器查询特征投影到相同的语义空间中,以估计其对当前已知类别语义的支持。
关键创新:MSPO的主要创新在于结合了已知类别的语言语义与视觉物体性,提供了一种有效的校准信号。这一方法与传统的视觉物体性方法相比,显著提高了已知与未知物体的区分能力。
关键设计:在设计中,MSPO使用了扩展的文本描述来涵盖类别属性、视觉外观、典型场景和功能使用,同时保持了PROB的损失函数和网络结构不变。
🖼️ 关键图片
📊 实验亮点
实验结果表明,MSPO在M-OWODB和S-OWODB数据集上显著提升了PROB基线的性能,PASCAL VOC的最终mAP提高了2.7分,同时保持了竞争力的未知召回率,展示了其有效性。
🎯 应用场景
该研究在开放世界物体检测领域具有广泛的应用潜力,尤其适用于自动驾驶、智能监控和机器人视觉等场景。通过提高未知物体的检测能力,MSPO能够帮助系统更好地适应动态环境,提升安全性和效率。
📄 摘要(原文)
Open-world object detection (OWOD) requires a detector to recognize known categories, discover unnamed objects from unseen categories, and incrementally learn newly annotated classes. PROB improves unknown discovery by modeling class-agnostic probabilistic objectness in the decoder-query space. However, visual objectness alone cannot determine whether an object-like query corresponds to a hard known instance, an unseen-category object, or background clutter, resulting in an ambiguous known-unknown decision boundary. We propose MSPO, a lightweight semantic calibration framework that augments PROB with task-aware known-category language priors while preserving its detector architecture and incremental learning protocol. For each currently known category, MSPO constructs an extended text description covering category attributes, visual appearance, typical scenes, and functional usage, and encodes it using a frozen CLIP text encoder. Decoder query features are projected into the same semantic space to estimate their support from the current known-category semantics. This semantic evidence is fused with PROB's visual objectness to calibrate known and unknown predictions without turning OWOD into open-vocabulary classification. Importantly, MSPO never uses future-category names, and all unseen categories remain unnamed during evaluation. Experiments on M-OWODB and S-OWODB show that MSPO improves the strong PROB baseline on the main aggregate metrics while retaining competitive unknown recall. It also improves early unknown-confusion metrics and raises PASCAL VOC final mAP by up to 2.7 points. These results demonstrate that known-category language semantics provide an effective calibration signal for probabilistic objectness under the standard OWOD setting.