SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

📄 arXiv: 2607.11008v1 📥 PDF

作者: Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

分类: cs.CV, cs.AI

发布日期: 2026-07-13

备注: Accepted by CVPR 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出SynCLIP以解决同义词引起的定位不一致问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 开放词汇感知 同义词处理 空间注意力 深度学习 计算机视觉

📋 核心要点

  1. 现有基于CLIP的方法在处理同义词时存在定位不一致性,导致性能下降。
  2. 提出SynCLIP框架,通过引入SSA和SAR模块,增强同义词的空间注意一致性。
  3. 在多个基准测试中,SynCLIP显著提高了定位一致性,达到了最先进的性能水平。

📝 摘要(中文)

开放词汇密集感知(OVDP)旨在通过利用文本知识来定位训练中未见过的物体。尽管基于CLIP的方法取得了显著进展,但我们发现了一个关键限制:同义词引起的定位不一致性,即语义等价的表达会产生不同的空间注意模式。这种不一致性削弱了现有方法在实际OVDP应用中的鲁棒性和性能。为了解决这一问题,我们提出了SynCLIP,一个增强同义词鲁棒定位的框架。SynCLIP引入了语义一致空间注意对齐模块(SSA),通过最小化原始表达和同义表达的注意图之间的差异来增强空间注意的一致性。此外,空间注意力精炼模块(SAR)选择性地增强对齐图中最相关的空间区域,以实现更精确和稳定的定位。通过构建同义词丰富视觉语料库(SEViC),我们为每个类别增加了多个同义词和文本定义。大量实验表明,SynCLIP在多种语言变体下显著提高了定位一致性,并在基于CLIP的OVDP方法中实现了最先进的性能。

🔬 方法详解

问题定义:论文要解决的问题是同义词引起的空间注意不一致性,这种不一致性影响了开放词汇密集感知(OVDP)的鲁棒性和性能。现有方法在处理语义等价的表达时,往往会产生不同的空间注意模式,从而导致定位不准确。

核心思路:论文的核心解决思路是通过引入语义一致空间注意对齐(SSA)模块和空间注意力精炼(SAR)模块,来增强同义词的空间注意一致性。SSA模块通过最小化原始和同义表达的注意图之间的差异,确保不同表达的空间注意模式保持一致。SAR模块则通过选择性地增强最相关的空间区域,进一步提高定位的准确性和稳定性。

技术框架:整体架构包括两个主要模块:SSA和SAR。SSA模块负责对齐不同表达的空间注意图,而SAR模块则在对齐后的图中强化最相关的区域。整个流程首先构建同义词丰富视觉语料库(SEViC),然后进行预训练,最后通过这两个模块进行优化。

关键创新:最重要的技术创新点在于引入了SSA和SAR模块,解决了同义词引起的注意不一致性问题。这与现有方法的本质区别在于,现有方法通常未考虑同义词之间的空间注意一致性。

关键设计:在设计中,SSA模块通过计算注意图之间的相似性损失来优化对齐,而SAR模块则通过加权选择最相关的空间区域进行精炼。具体的损失函数和网络结构设计旨在最大化空间注意的一致性和定位的准确性。实验中使用了多种基准数据集进行验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个基准测试中,SynCLIP显著提高了定位一致性,相较于基线方法,性能提升幅度达到XX%。具体实验结果表明,在处理同义词时,SynCLIP的空间注意一致性显著优于现有的CLIP-based OVDP方法,达到了最先进的性能水平。

🎯 应用场景

该研究的潜在应用领域包括智能监控、自动驾驶、机器人视觉等,能够在未见物体的情况下进行准确的物体定位。通过增强同义词的鲁棒性,SynCLIP可在多种复杂场景中提高机器视觉系统的性能,具有重要的实际价值和未来影响。

📄 摘要(原文)

Open-vocabulary dense perception (OVDP) aims to localize objects unseen during training by leveraging textual knowledge. Despite the remarkable progress of recent CLIP-based approaches, we identify a critical limitation: synonym-induced grounding inconsistency, where semantically equivalent expressions yield disparate spatial attention patterns. This inconsistency undermines the robustness and performance of existing methods in real-world OVDP applications. To address this issue, we propose SynCLIP, a Synonym-Coherent Language-Image Pretraining framework that enhances synonym-robust grounding for OVDP. SynCLIP introduces a Semantic-consistent Spatial Attention alignment (SSA) module to enhance spatial attention consistency by minimizing discrepancies between attention maps of original and synonymous expressions. Furthermore, a Spatial Attention Refinement (SAR) module selectively strengthens the most semantically relevant spatial regions within aligned maps for more precise and stable grounding. To support synonym-coherent pretraining, we also construct a Synonym-Enriched Visual Corpus (SEViC), which augments each category with multiple synonyms and textual definitions. Extensive experiments on multiple benchmarks demonstrate that SynCLIP substantially improves grounding consistency under diverse linguistic variants and achieves state-of-the-art performance among CLIP-based OVDP methods. Code is available at https://github.com/Justlovesmile/SynCLIP.