Multimodal Semantic-Aware Contrastive Learning For False Negative Mitigation in 3D Medical Imaging

📄 arXiv: 2607.14995v1 📥 PDF

作者: Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati

分类: cs.LG, q-bio.QM

发布日期: 2026-07-16


💡 一句话要点

提出多模态语义感知对比学习以解决医学影像中的假阴性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态学习 对比学习 医学影像 假阴性 语义相似性 深度学习 放射学报告 儿童脑肿瘤

📋 核心要点

  1. 现有的多模态对比学习方法在医学影像中假阴性问题上存在不足,无法有效处理语义相似样本。
  2. 本文提出的MseaCL框架通过引入语义相似性作为学习信号,旨在减轻假阴性对表示质量的影响。
  3. 实验结果显示,该框架在儿童脑肿瘤分子分类任务中,AUC提升了至少22.6%,证明了其有效性。

📝 摘要(中文)

多模态对比学习(CL)在对齐不同数据模态的表示和改善下游任务方面表现出色,尤其是在医疗领域。传统的CL框架假设数据批次内的实例对应关系,通常将所有未配对样本视为负样本。然而,在医学环境中,这一假设常常失效,因为样本可能共享高层语义属性,导致假阴性,从而降低表示质量。本文提出了多模态语义感知对比学习(MseaCL)框架,该框架在儿童3D脑部MRI扫描和放射学报告上进行训练,旨在通过引入放射学报告之间的语义相似性来减轻语义相似假阴性样本的影响。实验结果表明,该框架作为预训练阶段应用时,在下游任务中可显著提高性能,例如,在儿童脑肿瘤分子分类中,接收者操作特征曲线下面积(AUC)至少提高了22.6%。

🔬 方法详解

问题定义:本文旨在解决传统多模态对比学习在医学影像中假阴性样本处理不足的问题。现有方法通常将所有未配对样本视为负样本,导致在医学场景中出现较多假阴性,从而影响表示质量。

核心思路:MseaCL框架的核心思路是引入语义相似性作为学习信号,以减轻语义相似假阴性样本对模型训练的负面影响。通过在学习过程中考虑样本间的语义关系,提升模型对真实负样本的区分能力。

技术框架:该框架包括数据预处理、语义相似性计算、对比学习模块和下游任务评估四个主要阶段。首先对3D脑部MRI和放射学报告进行预处理,然后计算样本间的语义相似性,接着在对比学习模块中进行训练,最后在下游任务中评估模型性能。

关键创新:MseaCL的主要创新在于引入了语义感知机制,使得模型能够在训练过程中更好地处理语义相似的假阴性样本。这一设计与传统方法的本质区别在于不再简单地将所有未配对样本视为负样本,而是考虑其语义关系。

关键设计:在模型设计中,采用了特定的损失函数来平衡正负样本的影响,并通过深度学习网络结构来提取特征。此外,语义相似性计算使用了自然语言处理技术,以确保放射学报告的语义信息能够有效融入对比学习中。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,MseaCL框架在儿童脑肿瘤分子分类任务中,接收者操作特征曲线下面积(AUC)至少提高了22.6%。这一显著提升证明了该框架在处理医学影像中的假阴性问题方面的有效性,展示了其在临床应用中的潜力。

🎯 应用场景

该研究具有广泛的应用潜力,尤其是在医学影像分析和临床决策支持系统中。通过提高多模态数据的表示质量,MseaCL可以帮助医生更准确地诊断和分类疾病,特别是在儿童脑肿瘤等复杂病例中。未来,该方法有望推广到其他医学领域,提升医疗服务的质量和效率。

📄 摘要(原文)

Multimodal Contrastive Learning (CL) has shown significant performance in aligning representations across various data modalities and improving downstream tasks, especially in healthcare. It works by minimizing the distance between matched (positive) data modalities, while maximizing the distance between mismatched (negative) samples. Traditional CL frameworks typically assume instance-based correspondence within data batches, treating all non-paired samples as negatives. However, this assumption often fails in medical settings, where samples may share high-level semantic attributes, leading to false negatives that degrade representation quality. In this paper, we propose Multimodal Semantic-Aware Contrastive Learning (MseaCL), a CL framework trained on a pediatric cohort of 3D brain magnetic resonance imaging (MRI) scans and radiology reports. The goal of this framework is to mitigate the impact of semantically similar false negative samples by incorporating semantic similarity between radiology reports, as a guiding signal during the learning process. Our results indicate that applying this framework as a pretraining stage can achieve notable improvements in downstream tasks, e.g., at least a 22.6\% increase in the area under the receiver operating characteristic curve (AUC) of pediatric brain tumor molecular classification, demonstrating its potential for more robust and semantically aligned multimodal representations in clinical applications.