Deciphering Diagnoses: How Large Language Models Explanations Influence Clinical Decision Making

📄 arXiv: 2310.01708v1 📥 PDF

作者: D. Umerenkov, G. Zubkova, A. Nesterov

分类: cs.CL

发布日期: 2023-10-03


💡 一句话要点

探讨大型语言模型在临床决策支持中的应用与挑战

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 临床决策支持 医疗解释 医生评估 患者投诉

📋 核心要点

  1. 现有的临床决策支持系统在生成医疗决策解释时,缺乏足够的透明度和可靠性,影响医生的决策过程。
  2. 本研究提出利用大型语言模型生成患者投诉与诊断之间的解释,以提高医生对诊断的理解和一致性。
  3. 实验结果显示,LLM生成的解释显著提高了医生对诊断的一致性,但也暴露出5%到30%的潜在错误率,提示需谨慎使用。

📝 摘要(中文)

临床决策支持系统(CDSS)利用基于证据的知识和患者数据提供实时建议,而大型语言模型(LLMs)作为生成医疗决策解释的有前景工具。本研究探讨了LLMs在基于患者投诉生成诊断解释的有效性和可靠性。三位经验丰富的医生评估了LLM生成的解释与医生及模型分配的诊断之间的关联。实验结果表明,LLM解释显著提高了医生对给定诊断的一致性,并指出LLM输出中潜在的错误,范围从5%到30%。该研究强调了LLMs在医疗保健中的潜力与挑战,并强调了谨慎整合与评估的必要性,以确保患者安全和最佳临床效用。

🔬 方法详解

问题定义:本研究旨在解决现有临床决策支持系统在生成医疗决策解释时的透明度和可靠性不足的问题。现有方法往往无法有效帮助医生理解诊断依据,影响临床决策的质量。

核心思路:论文提出利用大型语言模型生成基于患者投诉的诊断解释,旨在通过自然语言的方式提高医生对诊断的理解和接受度。这种设计使得复杂的医疗信息以更易于理解的形式呈现。

技术框架:整体架构包括数据收集、LLM训练、生成解释和医生评估四个主要模块。首先收集患者投诉和相应的诊断数据,然后训练LLM生成解释,最后由医生评估这些解释的有效性和准确性。

关键创新:本研究的关键创新在于将LLM应用于医疗决策支持中,首次系统性地评估其生成的解释对医生决策的影响。这与传统的基于规则的系统有本质区别,后者通常缺乏灵活性和适应性。

关键设计:在模型训练中,使用了大量的医疗数据集,并设计了特定的损失函数以优化生成解释的质量。此外,模型的参数设置经过精细调整,以确保生成的解释既准确又易于理解。

📊 实验亮点

实验结果显示,LLM生成的解释显著提高了医生对诊断的一致性,医生的同意率提升了显著的比例。同时,研究指出LLM输出中存在5%到30%的潜在错误,提示在实际应用中需谨慎评估和整合。

🎯 应用场景

该研究的潜在应用领域包括医院的临床决策支持系统、医疗教育以及患者沟通工具。通过提高医生对诊断的理解,LLMs可以帮助改善患者的治疗效果和安全性,未来可能在医疗行业中发挥重要作用。

📄 摘要(原文)

Clinical Decision Support Systems (CDSS) utilize evidence-based knowledge and patient data to offer real-time recommendations, with Large Language Models (LLMs) emerging as a promising tool to generate plain-text explanations for medical decisions. This study explores the effectiveness and reliability of LLMs in generating explanations for diagnoses based on patient complaints. Three experienced doctors evaluated LLM-generated explanations of the connection between patient complaints and doctor and model-assigned diagnoses across several stages. Experimental results demonstrated that LLM explanations significantly increased doctors' agreement rates with given diagnoses and highlighted potential errors in LLM outputs, ranging from 5% to 30%. The study underscores the potential and challenges of LLMs in healthcare and emphasizes the need for careful integration and evaluation to ensure patient safety and optimal clinical utility.