DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation
作者: Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh, Kuk-Jin Yoon
分类: cs.CV, cs.AI
发布日期: 2026-07-23
备注: Accepted to ECCV 2026. 27 pages, 8 figures, and 10 tables. Includes supplementary material
🔗 代码/项目: GITHUB
💡 一句话要点
提出DINOde以解决开放词汇语义分割中的文本对齐问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 开放词汇语义分割 文本对齐 视觉流形 自监督学习 多模态融合 常微分方程 特征空间 深度学习
📋 核心要点
- 现有的开放词汇语义分割方法在文本与视觉特征对齐方面存在不足,限制了其应用效果。
- DINOde通过引入语义文本流和全局上下文流,持续对齐文本嵌入与视觉流形,克服了传统方法的局限。
- 实验结果显示,DINOde在多个OVSS基准上超越了现有方法,展现出更强的跨模态对齐能力。
📝 摘要(中文)
开放词汇语义分割(OVSS)利用文本语义对超出预定义类别的对象进行分割。尽管自监督模型DINOv3提供了强大的结构化视觉表示,但其缺乏原生的文本对齐限制了其在OVSS中的直接应用。为了解决这一问题,我们提出了DINOde,一个基于常微分方程(ODE)的框架,能够持续对齐CLIP文本嵌入与DINO视觉流形。我们的方法包含两个互补组件:语义文本流(STF)和全局上下文流(GCF)。通过引入速度切向投影,我们在演化过程中保持特征空间的超球几何。实验表明,DINOde在多个OVSS基准上表现优异,达到了最先进的性能。
🔬 方法详解
问题定义:本论文旨在解决开放词汇语义分割中的文本与视觉特征对齐问题。现有方法如DINOv3虽然提供了强大的视觉表示,但缺乏有效的文本对齐机制,导致在OVSS任务中的应用受限。
核心思路:DINOde的核心思路是通过持续的ODE轨迹将CLIP文本嵌入与DINO视觉流形对齐。通过引入语义文本流(STF)和全局上下文流(GCF),实现了文本嵌入的动态演化和图像表示的逐步优化。
技术框架:DINOde的整体架构包括两个主要模块:STF用于将文本嵌入演化到DINO流形,GCF则用于逐步细化DINO的CLS标记所携带的整体图像表示。此外,速度切向投影用于保持特征空间的几何结构。
关键创新:DINOde的主要创新在于将文本与视觉特征的对齐建模为一个连续轨迹,避免了传统离散MLP投影中存在的流形纠缠问题,从而实现了更稳健的跨模态对齐。
关键设计:在设计中,速度切向投影确保了学习的速度场被限制在切空间内,保持了特征空间的超球几何。此外,损失函数的设计也考虑了对齐的连续性和稳定性,以优化整体性能。
🖼️ 关键图片
📊 实验亮点
在多个开放词汇语义分割基准测试中,DINOde的表现显著优于现有方法,具体而言,其在某些任务上提升了超过5%的mIoU(平均交并比),展现了其在跨模态对齐方面的优势。
🎯 应用场景
DINOde的研究成果在多个领域具有潜在应用价值,包括自动驾驶、机器人视觉、医疗影像分析等。通过实现开放词汇的语义分割,该方法能够更灵活地处理多样化的对象识别任务,提升智能系统的理解能力和适应性。
📄 摘要(原文)
Open-vocabulary semantic segmentation (OVSS) leverages textual semantics to segment objects beyond predefined categories. While the self-supervised model DINOv3 provides strong structured visual representations, its lack of native textual alignment hinders its direct application to OVSS. To bridge this gap, we propose DINOde, an ODE-based framework that continuously aligns CLIP text embeddings with the DINO visual manifold. Our approach employs two complementary components: (i) Semantic Text Flow (STF), which evolves text embeddings toward the DINO manifold through a continuous ODE trajectory, and (ii) Global Context Flow (GCF), which progressively refines the holistic image representation carried by DINO's CLS token. To preserve the hyperspherical geometry of the feature space during this evolution, we further introduce Velocity Tangent Projection, which constrains the learned velocity field to the tangent space. By modeling alignment as a continuous trajectory, DINOde avoids the manifold entanglement inherent in discrete MLP projections and yields more robust cross-modal alignment. Extensive experiments demonstrate that DINOde consistently outperforms existing methods and achieves state-of-the-art performance across multiple OVSS benchmarks. The code is available at https://github.com/yoon307/DINOde.