X-FEMR: A Token-level Explainable Approach for Electronic Health Records Foundation Models using Transformer-based Models

📄 arXiv: 2607.06163v1 📥 PDF

作者: Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang

分类: cs.LG, cs.AI

发布日期: 2026-07-07

备注: Accepted by IJCAI-ECAI 2026 AI and Health Track


💡 一句话要点

提出基于Transformer的令牌级可解释性方法以解决电子健康记录模型的黑箱问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 电子健康记录 基础模型 可解释性 Transformer 临床预测 机器学习 临床信任

📋 核心要点

  1. 现有的电子健康记录基础模型(FEMRs)作为黑箱模型,缺乏可解释性,导致临床应用中的信任问题。
  2. 本文提出了一种基于Transformer的令牌级可解释性方法,通过训练替代模型来近似FEMR的行为,识别影响预测的关键令牌。
  3. 实验结果显示,替代模型的预测与FEMR高度一致,且令牌级解释与临床知识相符,提升了模型的可解释性和可信度。

📝 摘要(中文)

电子健康记录基础模型(FEMRs)在大规模结构化患者数据上进行预训练,使其能够将患者的纵向轨迹转化为可用于多种临床预测任务的可泛化表示。然而,FEMRs仍然是黑箱模型,存在偏见、可解释性和临床信任等问题。为了解决这些问题,本文提出了首个针对FEMRs的令牌级可解释性方法。我们训练了一个基于Transformer的替代模型,通过输入-输出对近似FEMR的行为,同时保留时间动态。我们识别出最具影响力的令牌,提供了FEMRs如何利用患者历史的不同方面进行预测的见解。通过引入新的临床对齐指标,我们量化了替代模型的关键令牌与临床验证特征之间的对应关系。实验结果表明,替代模型的预测与FEMR的预测高度一致,令牌级解释与临床知识良好对齐,提供了一个可解释和可信的临床AI框架。

🔬 方法详解

问题定义:本文旨在解决电子健康记录基础模型(FEMRs)作为黑箱模型所带来的可解释性不足和临床信任问题。现有方法无法提供足够的透明度,导致临床医生对模型预测的信任度降低。

核心思路:论文提出了一种基于Transformer的令牌级可解释性方法,通过训练一个替代模型来近似FEMR的行为,识别出对预测影响最大的令牌,从而提供可解释的预测依据。

技术框架:整体架构包括数据预处理、替代模型训练和关键令牌识别三个主要模块。首先,从FEMR中提取输入-输出对,然后训练Transformer模型,最后分析模型输出以识别影响预测的关键令牌。

关键创新:最重要的技术创新在于首次引入令牌级可解释性,能够具体分析每个令牌对模型预测的贡献,这与现有方法的全局可解释性形成鲜明对比。

关键设计:在模型训练中,采用了特定的损失函数以确保替代模型的输出与FEMR的输出尽可能接近,同时设计了新的临床对齐指标来量化关键令牌与临床特征的对应关系。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,替代模型的预测与FEMR的预测高度一致,令牌级解释与临床知识良好对齐。具体而言,替代模型在两个预测任务中的表现与FEMR相近,且关键令牌的识别与临床验证特征的对应关系显著提高了模型的可解释性。

🎯 应用场景

该研究的潜在应用领域包括临床决策支持系统、个性化医疗和健康管理等。通过提升电子健康记录模型的可解释性,能够增强临床医生对AI系统的信任,从而促进AI在医疗领域的广泛应用和接受。

📄 摘要(原文)

Foundation Models for Electronic Health Records (FEMRs) are pretrained on large-scale structured patient data, enabling them to convert longitudinal patient trajectories into generalizable representations for diverse clinical prediction tasks. Despite their effectiveness, FEMRs remain black-box models, raising concerns about bias, interpretability, and clinical trust. To address this, we propose the first token-level explainability approach for FEMRs. We train a Transformer-based surrogate model on input-output pairs from the FEMR across two prediction tasks, approximating its behavior while preserving temporal dynamics. We identify the most influential tokens, providing insights into how FEMRs leverage different aspects of patient history for predictions. To evaluate clinical relevance, we introduce a novel clinical alignment metric that quantifies the correspondence between the surrogate model's key tokens and clinically validated features. Our results demonstrate that the surrogate closely approximates FEMR predictions and that token-level explanations align well with clinical knowledge, offering a practical framework for interpretable and trustworthy clinical AI.