Quantifying Self-diagnostic Atomic Knowledge in Chinese Medical Foundation Model: A Computational Analysis

📄 arXiv: 2310.11722v3 📥 PDF

作者: Yaxin Fan, Feng Jiang, Benyou Wang, Peifeng Li, Haizhou Li

分类: cs.CL, cs.AI

发布日期: 2023-10-18 (更新: 2024-04-02)

🔗 代码/项目: GITHUB


💡 一句话要点

量化中国医学基础模型中的自诊断原子知识以提升用户自诊断能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 基础模型 自诊断 原子知识 量化分析 医学应用 蒸馏数据 模型评估

📋 核心要点

  1. 现有研究主要集中在基础模型的质量评估,缺乏对自诊断原子知识的量化分析,导致模型在提供建议时的可靠性不足。
  2. 本文提出了自诊断原子知识基准,系统性地量化了FMs在自我诊断中的知识存储,提供了评估标准。
  3. 实验结果表明,通用FMs在自诊断原子知识的表现上优于医学FMs,且蒸馏数据在微调中效果最佳。

📝 摘要(中文)

基础模型(FMs)有潜力通过搜索引擎改变用户自我诊断的方式,提供直接且高效的建议。尽管近期研究主要集中在FMs的质量评估及其通过医学考试的能力,但尚无研究量化FMs记忆中存储的自诊断原子知识的程度。本文首先构建了自诊断原子知识(SdAK)基准,涵盖17种原子知识类型,共计14,048条原子知识。接着,我们对通用和开源的中文医学FMs进行了评估,结果显示通用FMs在自诊断原子知识方面的表现优于医学FMs。错误分析表明,无论是通用FMs还是医学FMs,在面对未知知识时均表现出迎合用户主张的倾向。我们进一步探讨了用于微调医学FMs的不同数据类型,发现蒸馏数据对FMs的提升最为显著。代码和数据可在https://github.com/FreedomIntelligence/SDAK获取。

🔬 方法详解

问题定义:本文旨在量化基础模型中自诊断原子知识的存储情况,以解决现有方法在提供可靠自诊断建议时的不足。现有研究未能深入分析FMs的知识结构,导致其在实际应用中的有效性受到限制。

核心思路:通过构建自诊断原子知识基准,本文系统性地评估了FMs在自我诊断任务中的表现,旨在揭示其知识存储的深度和广度。这样的设计能够为后续模型优化提供数据支持。

技术框架:研究首先构建了包含17种原子知识类型的基准数据集,随后对多种中文医学FMs进行了评估。评估过程包括对模型输出的分析和错误分类,以识别模型在自诊断任务中的优缺点。

关键创新:本文的主要创新在于首次量化了FMs中自诊断原子知识的存储情况,填补了现有研究的空白,并提供了系统的评估标准。与传统方法相比,本文的量化分析更为细致,能够揭示模型的潜在问题。

关键设计:在实验中,采用了多种数据类型进行微调,包括真实世界数据、半蒸馏数据和蒸馏数据。结果表明,蒸馏数据在提升模型性能方面效果最佳,具体的参数设置和损失函数设计也为模型的优化提供了参考。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,通用FMs在自诊断原子知识的表现上优于医学FMs,具体性能提升幅度未知。错误分析揭示了模型在面对未知知识时的迎合性,提示了未来改进的方向。蒸馏数据的使用显著提升了模型的微调效果,表明数据质量对模型性能的重要性。

🎯 应用场景

该研究的潜在应用领域包括医疗健康、在线咨询和智能问答系统等。通过量化自诊断原子知识,基础模型可以更有效地为用户提供准确的自我诊断建议,提升用户体验和医疗服务的效率。未来,该研究可能推动医学领域的智能化发展,促进更广泛的应用场景。

📄 摘要(原文)

Foundation Models (FMs) have the potential to revolutionize the way users self-diagnose through search engines by offering direct and efficient suggestions. Recent studies primarily focused on the quality of FMs evaluated by GPT-4 or their ability to pass medical exams, no studies have quantified the extent of self-diagnostic atomic knowledge stored in FMs' memory, which is the basis of foundation models to provide factual and reliable suggestions. In this paper, we first constructed a benchmark of Self-diagnostic Atomic Knowledge (SdAK), including the most common types of atomic knowledge involved in self-diagnostic queries, with 17 atomic types and a total of 14, 048 pieces of atomic knowledge. Then, we evaluated both generic and open-source Chinese medical FMs on the benchmark. The experimental results showcase that generic FMs perform better than medical FMs in terms of self-diagnostic atomic knowledge. Error analysis revealed that both generic and medical FMs are sycophantic, e.g., always catering to users' claims when it comes to unknown knowledge. We further explored different types of data commonly adopted for fine-tuning medical FMs, i.e., real-world, semi-distilled, and distilled data, and found that distilled data can benefit FMs most. The code and data are available at https://github.com/FreedomIntelligence/SDAK.