SMILE: Self-Explainable Multimodal Information Bottleneck for Medical Diagnosis

📄 arXiv: 2609.05174v1 📥 PDF

作者: Yuqing Yang, Alexander Schmatz, Zhaozhao Ma, Changkyu Choi, Robert Jenssen, Shujian Yu

分类: cs.CV, cs.LG

发布日期: 2026-09-04

备注: 30 pages, 10 figures


💡 一句话要点

提出自解释多模态信息瓶颈以解决医疗诊断中的可解释性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 可解释性 多模态诊断 信息瓶颈 医疗人工智能 特征相关性 临床决策 Renyi熵 模型优化

📋 核心要点

  1. 现有的医疗可解释性方法多为事后分析,且主要针对单一模态数据,限制了其在多模态诊断中的应用。
  2. 本文提出了一种基于信息瓶颈框架的自解释多模态诊断方法,优化预测性能与模态特定的可解释性。
  3. 在多个医疗数据集上进行的实验显示,该方法在准确性上有显著提升,iCTCF数据集的准确率提高了9.1个百分点。

📝 摘要(中文)

可解释性在基于人工智能的医疗诊断中被视为关键要求,尤其是在安全关键的临床决策中。现有的可解释性方法多为事后分析,且主要针对单一模态数据,限制了其在多模态诊断中的应用。本文通过信息瓶颈框架提出了一种自解释的多模态诊断方法,旨在优化预测性能和模态特定的可解释性,识别对诊断决策最具信息量的元素。实验结果表明,该方法在多个医疗数据集上表现出色,iCTCF数据集的准确率提升了9.1个百分点,同时提供了透明且模态感知的特征相关性洞察,增强了可解释性和泛化能力。

🔬 方法详解

问题定义:本文旨在解决医疗诊断中可解释性不足的问题,现有方法多为事后分析,无法有效处理多模态数据的复杂性。

核心思路:提出一种自解释的多模态诊断方法,通过信息瓶颈框架优化预测性能与可解释性,识别各模态中对诊断决策最具信息量的元素。

技术框架:整体架构包括数据预处理、模态特征提取、信息瓶颈优化和可解释性分析四个主要模块,确保各个阶段的有效协同。

关键创新:引入矩阵形式的Renyi $α$-阶熵函数,允许在充分表达的编码器假设下进行可行且稳定的优化,这是与现有方法的本质区别。

关键设计:采用特定的损失函数来平衡预测性能与可解释性,同时在网络结构中设计了多模态特征融合模块,以增强模型的整体表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在多个医疗数据集上均表现出色,尤其是在iCTCF数据集上,准确率提升了9.1个百分点,显著优于现有基线方法。此外,所学得的解释提供了透明且模态感知的特征相关性洞察,增强了模型的可解释性和泛化能力。

🎯 应用场景

该研究的潜在应用领域包括医疗影像分析、临床决策支持系统和个性化医疗等。通过提高多模态数据的可解释性,能够帮助医生更好地理解模型的决策过程,从而提升患者的安全性和治疗效果。未来,该方法有望在更广泛的医疗场景中推广应用,推动智能医疗的发展。

📄 摘要(原文)

Explainability is increasingly seen as a crucial requirement in AI-based medical diagnosis, particularly in safety-critical clinical decision-making. Most existing explainability methods in healthcare operate in a post-hoc manner and are predominantly designed for unimodal data, which limits their applicability in increasingly prevalent multimodal diagnostic settings. This paper addresses the problem of self-explainable multimodal diagnosis by formulating it within the information bottleneck (IB) framework. We propose a unified learning paradigm that jointly optimizes predictive performance and modality-specific explainability by identifying the most informative elements inside each modality that contribute to diagnostic decisions. To enable tractable and stable optimization, we employ a matrix-based Renyi's $α$-order entropy functional under the assumption of sufficiently expressive encoders. Extensive experiments on representative medical datasets spanning heterogeneous modalities demonstrate that the proposed method consistently achieves strong diagnostic performance, including an absolute accuracy improvement of 9.1 percentage points on the iCTCF dataset. Moreover, the learned explanations provide transparent and modality-aware insights into feature relevance, thereby improving both the explainability and generalization.