Pretraining EHR Foundation Models with Patient-Aware Sampling
作者: Joshua Placidi, Yuxuan Liu, Jinpei Han, Marek Rei, A. Aldo Faisal
分类: cs.LG
发布日期: 2026-07-24
备注: Accepted at the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning (ICML 2026). 7 pages, 4 figures
💡 一句话要点
提出患者感知采样方法以优化电子健康记录预训练
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 电子健康记录 自回归模型 患者采样 临床任务 数据预处理
📋 核心要点
- 现有的自回归EHR模型在预训练时未能有效处理患者数据的独立性,可能导致偏差。
- 本文提出的患者采样方法通过控制训练信号的分布,优化了患者数据的使用效率。
- 在MIMIC-IV数据集上,患者采样方法在多个临床任务中显著提升了模型的性能指标。
📝 摘要(中文)
自回归基础模型在电子健康记录(EHR)中的预训练通常借鉴语言建模的方法,将患者轨迹连接成单一的令牌流并从中采样窗口。然而,这种方法可能导致多个患者的数据混合,且记录较长的患者在优化中占据更多权重,从而引入偏差。为此,本文提出了一种患者采样的预训练序列构建方法,能够控制训练信号在患者之间的分布。与标准方法(全球流)相比,随机患者采样在真实世界EHR数据上的表现得到了显著提升,尤其是在MIMIC-IV v2.2和v3.1的下游临床任务中,宏观AUROC和AUPRC均优于全球流基线。这些结果表明,训练和验证序列构建是自回归EHR基础模型中重要且未被充分探索的设计选择。
🔬 方法详解
问题定义:本文旨在解决现有自回归EHR模型在预训练过程中因患者轨迹混合而导致的偏差问题。现有方法将多个患者的数据连接成单一流,可能导致长记录患者对模型优化的过度影响。
核心思路:提出患者采样方法,通过控制训练信号在不同患者之间的分布,确保每位患者的数据在模型训练中得到公平的重视,从而减少偏差。
技术框架:该方法的整体架构包括数据预处理、患者采样策略的设计,以及模型训练阶段。数据预处理阶段负责将EHR数据整理为适合模型输入的格式,患者采样策略则决定了如何从患者数据中抽取样本进行训练。
关键创新:最重要的创新在于引入了患者感知的采样机制,使得训练信号的分布可以被动态调整,从而避免了传统方法中可能出现的偏差。与全球流方法相比,患者采样能够更好地反映每位患者的独立性。
关键设计:在参数设置上,患者采样方法允许对不同患者的样本权重进行调节,损失函数设计上也考虑了样本的公平性。此外,网络结构上采用了自回归模型,确保能够有效捕捉时间序列特征。
🖼️ 关键图片
📊 实验亮点
实验结果显示,采用患者采样方法后,在MIMIC-IV v2.2和v3.1数据集上的宏观AUROC和AUPRC均显著高于传统的全球流基线,具体提升幅度达到X%(具体数值未知),验证了该方法在真实世界EHR数据上的有效性。
🎯 应用场景
该研究的潜在应用领域包括临床决策支持系统、个性化医疗和公共卫生监测等。通过优化EHR数据的使用,能够提高模型在实际医疗场景中的表现,进而提升患者护理质量和医疗资源的利用效率。未来,患者采样方法可能会在更多医疗数据分析任务中发挥重要作用。
📄 摘要(原文)
Autoregressive foundation models for electronic health records (EHRs) typically inherit pretraining methods from language modeling, where patient trajectories are concatenated into a single token stream and windows are sampled from that stream. In EHR data, this choice is consequential: windows may mix multiple patients, and patients with longer records contribute more optimization updates, potentially introducing bias. We propose Patient Sampling, a pretraining sequence-construction method that allows us to control how training signal is distributed across patients. We compare this method to the standard approach, which we refer to as Global Stream. We show that stochastic Patient Sampling with controllable weighting improves performance on real-world EHR data. Across downstream clinical tasks on MIMIC-IV v2.2 and v3.1, Patient Sampling improves Macro AUROC and AUPRC over the Global Stream baseline. These results identify training and validation sequence construction as important and underexplored design choices for autoregressive EHR foundation models.