Cross-modal triage network: a multimodal deep learning framework for severity-based triage and visual explainability in chest radiographs

📄 arXiv: 2609.04357v1 📥 PDF

作者: Zinah Ghulam, Richa Mittal, Eranga Ukwatta

分类: eess.IV, cs.AI, cs.CV

发布日期: 2026-09-03


💡 一句话要点

提出跨模态分诊网络以解决胸部X光片分诊瓶颈问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态深度学习 胸部X光 分诊网络 可视化解释 病理检测 Swin Transformer PubMedBERT 临床应用

📋 核心要点

  1. 现有的AI工具主要为单模态二分类器,缺乏对病情严重程度的识别,导致分诊效率低下。
  2. 提出跨模态分诊网络(CMTN),结合Swin Transformer V2视觉编码器与PubMedBERT文本编码器,通过门控交叉注意力进行融合。
  3. CMTN在14种病理上取得了0.9970的宏观AUROC,且在分诊效率上优于现有的BioViL基线,但与放射科医师的判断一致性较低。

📝 摘要(中文)

本研究旨在解决胸部X光(CXR)扫描数量增加导致的分诊瓶颈问题。现有的AI工具主要是单模态二分类器,缺乏对病情严重程度的意识,而多模态系统很少与专家放射科医师进行基准比较。为此,研究者们开发了一种多模态深度学习框架,旨在实现联合的严重程度分诊、病理检测和可视化解释。通过对34,639个图像-文本对进行训练,提出的跨模态分诊网络(CMTN)在多个指标上表现出色,尽管在与放射科医师的真实判断上存在差距,强调了临床应用前需要放射科医师标注的真实标签。

🔬 方法详解

问题定义:本研究旨在解决胸部X光片分诊中由于扫描数量增加而导致的分诊瓶颈问题。现有方法主要是单模态二分类器,缺乏对病情严重程度的识别,导致急诊检查排队在常规检查之后。

核心思路:提出跨模态分诊网络(CMTN),通过结合视觉和文本信息来实现对病情严重程度的联合分诊和病理检测。该设计旨在提高分诊的准确性和效率,同时提供可视化解释。

技术框架:CMTN的整体架构包括一个Swin Transformer V2视觉编码器和一个PubMedBERT文本编码器,通过门控交叉注意力进行信息融合。模型在34,639个图像-文本对上进行训练,优化了四级严重程度分诊的序数焦点损失和14种病理的二元交叉熵损失。

关键创新:CMTN的主要创新在于其多模态融合能力,能够同时处理视觉和文本信息,显著提高了对病情严重程度的识别能力,与现有的单模态方法相比具有本质区别。

关键设计:在训练过程中,使用了序数焦点损失函数来优化四级严重程度分诊,同时采用二元交叉熵损失来处理14种病理。模型的训练数据来自MIMIC-CXR-JPG,包含12,489名患者的图像-文本对。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

CMTN在14种病理上实现了0.9970的宏观AUROC,且在四级严重程度分诊上与参考标签的二次加权Kappa值达到0.9341,表现优于现有的BioViL基线(QWK = 0.7679)。然而,临床审计显示与放射科医师的判断一致性较低(QWK = 0.1399),强调了真实标签的重要性。

🎯 应用场景

该研究的潜在应用领域包括医疗影像分析、放射科辅助诊断和智能医疗系统。通过提高胸部X光片的分诊效率和准确性,CMTN有望在临床实践中减轻放射科医师的工作负担,并提升患者的就诊体验。未来,该框架还可以扩展到其他类型的医学影像分析中。

📄 摘要(原文)

Purpose: Increased number of chest radiograph (CXR) scans create a triage bottleneck, queueing urgent examinations behind routine ones. Existing AI tools are predominantly unimodal binary classifiers lacking severity awareness, and multimodal systems are rarely benchmarked against expert radiologists. To this end, we developed a multimodal deep learning framework for joint severity triage, pathology detection, and native visual explanation. Approach: We propose the cross-modal triage network (CMTN), fusing a Swin Transformer V2 visual encoder with a PubMedBERT text encoder via gated cross-attention. The CMTN was trained on 34,639 image-text pairs (12,489 patients) from MIMIC-CXR-JPG, optimizing an ordinal focal loss for four-tier severity triage and binary cross-entropy for 14 pathologies. Beyond quantitative benchmarking, attention heatmaps were evaluated against a blinded expert radiologist in a two-phase clinical audit comparing model triage output to expert severity assessment (100 cases) and grading spatial-semantic concordance (116 heatmaps). Results: The CMTN achieved strong ordinal agreement with reference labels (quadratic weighted kappa [QWK] = 0.9341, 95\% CI: 0.9219 to 0.9449) and macro-AUROC of 0.9970 across 14 pathologies, with 34~ms latency, outperforming the state-of-the-art BioViL multimodal baseline (QWK = 0.7679). However, the blinded Phase I clinical audit revealed substantially lower agreement with genuine radiologist judgment (QWK = 0.1399). Phase II found 54.3\% of heatmaps achieved clinically acceptable spatial localization. Conclusions: The CMTN demonstrated an efficient multimodal architecture for CXR triage. The divergence between algorithmic and radiologist agreement demonstrates that benchmark performance against NLP-derived labels is insufficient, highlighting the need for radiologist-labeled ground truth before clinical deployment.