UMSS: Towards Unsupervised Multi-modal Semantic Segmentation
作者: Haitian Zhang, Thai Duy Nguyen, Xiangyuan Wang, Mohan Liu, Lin Wang
分类: cs.CV
发布日期: 2026-07-14
💡 一句话要点
提出UniM2以解决无监督多模态语义分割问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 无监督学习 多模态语义分割 跨模态融合 深度学习 计算机视觉
📋 核心要点
- 现有无监督语义分割方法在多模态数据上扩展时,常因缺乏明确监督而导致融合效果下降,难以有效利用不同传感器的互补信息。
- 本文提出的UniM2框架通过跨模态对应协同(CMCS)学习统一潜在空间,避免了对标签的依赖,从而实现了有效的多模态信息融合。
- 在NYU Depth v2和MFNet数据集上的实验结果显示,UniM2分别提高了6.4%和9.8%的mIoU,显著优于现有的多模态语义分割框架。
📝 摘要(中文)
多模态语义分割(MSS)在复杂环境中的稳健感知中至关重要,但由于人工标注成本高,其潜力尚未得到充分挖掘。尽管无监督语义分割(USS)在单一RGB模态上取得了良好效果,但其在多模态数据上的简单扩展常常受到融合降级的阻碍。本文首次提出无监督多模态语义分割(UMSS)问题,旨在在完全无标签的情况下有效利用互补传感器信息。为此,我们提出了基于DINOv3的UniM2框架,通过跨模态对应协同(CMCS)学习统一的潜在空间,提取内在共享语义线索,避免了标签引导的自适应融合需求。我们还引入了跨模态协调器(CMH),将RGB作为稳定参考,有效抑制不一致的关系监督,同时引导模型利用互补结构特征。实验证明,UniM2在NYU Depth v2和MFNet上分别提高了6.4%和9.8%的mIoU,显示出明显的优势。
🔬 方法详解
问题定义:本文解决的是无监督多模态语义分割(UMSS)问题。现有方法在多模态数据上扩展时,常因缺乏明确的监督信号而导致融合性能下降,无法有效利用不同传感器所捕获的互补信息。
核心思路:论文的核心思路是通过跨模态对应协同(CMCS)学习一个统一的潜在空间,以提取共享的语义线索,避免依赖标签引导的自适应融合,从而提高多模态信息的利用效率。
技术框架:UniM2框架基于DINOv3构建,主要包括两个模块:跨模态对应协同(CMCS)模块和跨模态协调器(CMH)。CMCS模块负责学习统一的潜在空间,而CMH模块则将RGB作为稳定参考,抑制不一致的监督信号。
关键创新:本文的主要创新在于提出了CMCS和CMH两个模块,前者通过学习共享语义线索来实现有效的多模态融合,后者则通过将RGB作为参考来解决模态间的冲突,这与现有方法的设计思路有本质区别。
关键设计:在技术细节上,UniM2采用了特定的损失函数来平衡不同模态的信息流,并设计了适应性的网络结构,以确保模型在无标签情况下仍能有效学习到互补特征。
🖼️ 关键图片
📊 实验亮点
在NYU Depth v2和MFNet数据集上的实验结果表明,UniM2在无监督多模态语义分割任务中分别提高了6.4%和9.8%的mIoU,相较于现有框架展现出明显的性能优势,验证了其有效性和创新性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人感知和智能监控等场景。在这些复杂环境中,能够有效利用多种传感器数据进行语义分割,将显著提升系统的感知能力和决策效率。未来,该方法有望推动无监督学习在多模态任务中的广泛应用。
📄 摘要(原文)
Multimodal semantic segmentation (MSS) is essential for robust perception in complex environments, yet its potential remains largely untapped because of the prohibitive cost of human annotations. While unsupervised semantic segmentation (USS) has achieved strong results on a single RGB modality, its naive extension to multimodal data is often hindered by fusion degradation. This occurs because, without explicit supervision, existing frameworks struggle to reconcile the heterogeneous structural patterns captured by different sensors and therefore fail to effectively exploit their complementary information. In this paper, we make the first attempt to address the novel problem of Unsupervised Multimodal Semantic Segmentation (UMSS), aiming to effectively exploit complementary sensor information in a fully label free setting. To this end, we propose UniM2 (Unified Multimodal), a novel framework built on DINOv3 that transforms conventional fusion methods into consistent performance gains. Our key idea is to learn a unified latent space driven by Cross Modal Correspondence Synergy (CMCS) to extract intrinsic shared semantic cues, bypassing the need for label guided adaptive fusion. To mitigate inherent intermodal conflicts, we introduce a Cross Modal Harmonizer (CMH) that designates RGB as a stable reference, effectively suppressing inconsistent relational supervision while guiding the model to exploit complementary structural features. Extensive experimental results on NYU Depth v2 and MFNet show that UniM2 improves mIoU by 6.4% and 9.8%, respectively, demonstrating clear advantages over existing frameworks for UMSS.