Contextualized Policy Recovery: Modeling and Interpreting Medical Decisions with Adaptive Imitation Learning
作者: Jannik Deuschel, Caleb N. Ellington, Yingtao Luo, Benjamin J. Lengerich, Pascal Friederich, Eric P. Xing
分类: cs.LG, cs.AI, stat.ML
发布日期: 2023-10-11 (更新: 2024-05-07)
💡 一句话要点
提出上下文化政策恢复方法以解决医疗决策可解释性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 可解释人工智能 医疗决策 多任务学习 上下文建模 政策恢复 抗生素处方 阿尔茨海默病 动态决策
📋 核心要点
- 现有可解释政策学习方法在准确性与可解释性之间存在权衡,限制了对人类决策过程的有效解释。
- 本文提出上下文化政策恢复(CPR),将复杂决策建模为多任务学习问题,以适应动态的决策过程。
- CPR在重症监护室抗生素处方和阿尔茨海默病患者MRI处方预测上显著提升了AUROC,缩小了可解释与黑箱方法的准确性差距。
📝 摘要(中文)
可解释的政策学习旨在从观察到的行为中估计可理解的决策政策,但现有模型在准确性与可解释性之间存在权衡,限制了对人类决策过程的数据驱动解释。现有方法将决策过程视为统一政策,而人类决策实际上是动态的,受不同上下文影响。因此,本文提出上下文化政策恢复(CPR),将复杂决策过程建模为多任务学习问题,每个上下文对应一个独特任务,复杂决策政策可以通过多个简单的上下文特定政策逐步构建。CPR通过线性映射建模每个上下文特定政策,并在上下文更新时按需生成新的政策模型。我们提供了两种CPR框架,分别关注局部可解释性和全局可解释性。通过模拟和真实数据的研究,CPR在重症监护室抗生素处方预测上实现了22%的AUROC提升,在阿尔茨海默病患者MRI处方预测上实现了7.7%的AUROC提升。
🔬 方法详解
问题定义:本文旨在解决现有可解释政策学习方法在准确性与可解释性之间的权衡问题。现有方法通常将决策过程视为统一的政策,无法有效捕捉人类决策的动态性和上下文依赖性。
核心思路:提出上下文化政策恢复(CPR),将复杂决策过程视为多任务学习问题。每个上下文被视为一个独特任务,通过组合多个简单的上下文特定政策来构建复杂决策政策。
技术框架:CPR的整体架构包括上下文特定政策的线性映射建模和按需生成新政策模型的机制。框架分为两个主要模块:局部可解释性模块和全局可解释性模块,分别满足不同的可解释性需求。
关键创新:CPR的核心创新在于将决策过程动态化,通过上下文特定的线性映射来实现高效的政策恢复。这一方法与传统的统一政策方法本质上不同,能够更好地适应复杂的决策环境。
关键设计:在模型设计中,CPR使用线性映射来表示每个上下文特定政策,并通过更新观察数据来动态生成新政策。此外,损失函数的设计考虑了局部和全局可解释性的平衡,确保模型的有效性和可解释性。
🖼️ 关键图片
📊 实验亮点
CPR在重症监护室抗生素处方预测中实现了22%的AUROC提升,超越了之前的最先进技术;在阿尔茨海默病患者MRI处方预测中也取得了7.7%的AUROC提升。这些结果表明CPR在提高可解释性和准确性方面的显著优势,缩小了可解释与黑箱方法之间的性能差距。
🎯 应用场景
该研究的潜在应用领域包括医疗决策支持系统、个性化治疗方案制定以及临床决策分析等。通过提供可解释的决策模型,CPR能够帮助医疗专业人员更好地理解和优化治疗决策,提升患者护理质量。未来,该方法可能在其他领域的决策支持系统中发挥重要作用,推动可解释人工智能的发展。
📄 摘要(原文)
Interpretable policy learning seeks to estimate intelligible decision policies from observed actions; however, existing models force a tradeoff between accuracy and interpretability, limiting data-driven interpretations of human decision-making processes. Fundamentally, existing approaches are burdened by this tradeoff because they represent the underlying decision process as a universal policy, when in fact human decisions are dynamic and can change drastically under different contexts. Thus, we develop Contextualized Policy Recovery (CPR), which re-frames the problem of modeling complex decision processes as a multi-task learning problem, where each context poses a unique task and complex decision policies can be constructed piece-wise from many simple context-specific policies. CPR models each context-specific policy as a linear map, and generates new policy models $\textit{on-demand}$ as contexts are updated with new observations. We provide two flavors of the CPR framework: one focusing on exact local interpretability, and one retaining full global interpretability. We assess CPR through studies on simulated and real data, achieving state-of-the-art performance on predicting antibiotic prescription in intensive care units ($+22\%$ AUROC vs. previous SOTA) and predicting MRI prescription for Alzheimer's patients ($+7.7\%$ AUROC vs. previous SOTA). With this improvement, CPR closes the accuracy gap between interpretable and black-box methods, allowing high-resolution exploration and analysis of context-specific decision models.