Segmented Harmonic Loss: Handling Class-Imbalanced Multi-Label Clinical Data for Medical Coding with Large Language Models

📄 arXiv: 2310.04595v1 📥 PDF

作者: Surjya Ray, Pratik Mehta, Hongen Zhang, Ada Chaman, Jian Wang, Chung-Jen Ho, Michael Chiou, Tashfeen Suleman

分类: cs.CL, cs.AI

发布日期: 2023-10-06

备注: 16 pages,3 figures, 3 tables


💡 一句话要点

提出分段谐波损失以解决医疗编码中的类不平衡问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 医疗编码 类不平衡 大型语言模型 分段谐波损失 多标签学习 嵌入相似性 噪声数据处理

📋 核心要点

  1. 现有医疗编码方法在处理类不平衡和噪声数据时表现不佳,导致模型性能下降。
  2. 提出分段谐波损失,通过分段和解耦共现类来应对多标签场景中的类不平衡问题。
  3. 实验结果显示,使用该损失函数的LLMs在长尾数据集上F1分数提升超过十个百分点,显著优于现有方法。

📝 摘要(中文)

大型语言模型(LLMs)的迅速崛起对医疗领域产生了深远影响,尤其是在医疗编码任务中。本文评估了LLMs在真实噪声数据上的表现,采用MIMIC III和IV数据集进行实验。为应对多标签场景中的极端类不平衡问题,提出了一种新损失函数——分段谐波损失,通过新的分段算法对共现类进行分离。此外,基于嵌入相似性的方法也被提出以处理噪声数据。实验结果表明,使用该损失函数训练的LLMs在噪声长尾数据集上显著提升了性能,F1分数超过了现有最优方法十个百分点以上。

🔬 方法详解

问题定义:本文旨在解决医疗编码任务中的类不平衡问题,现有方法在处理多标签数据时容易受到噪声和类不平衡的影响,导致性能下降。

核心思路:提出分段谐波损失,通过对共现类进行分段和解耦,改善模型对类不平衡的适应性,并结合嵌入相似性技术处理噪声数据。

技术框架:整体架构包括数据预处理、分段谐波损失计算、模型训练和评估四个主要模块。数据预处理阶段清洗噪声数据,分段谐波损失模块则负责计算损失并引导模型学习。

关键创新:分段谐波损失是本文的核心创新,与传统损失函数不同,它能够有效处理多标签场景中的类不平衡问题,通过分段算法优化模型学习过程。

关键设计:损失函数设计中,采用了新的分段算法来识别和处理共现类,嵌入相似性技术用于评估噪声数据的影响,确保模型在训练过程中能够更好地适应数据特性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,使用分段谐波损失训练的LLMs在MIMIC III和IV数据集上取得了显著提升,F1分数超过了现有最优方法十个百分点以上,证明了该方法在处理噪声和类不平衡数据方面的有效性。

🎯 应用场景

该研究的潜在应用领域包括医疗编码、临床数据分析和智能医疗系统。通过提高医疗编码的准确性,能够有效支持临床决策和患者管理,未来可能推动医疗行业在数据驱动决策方面的进一步发展。

📄 摘要(原文)

The precipitous rise and adoption of Large Language Models (LLMs) have shattered expectations with the fastest adoption rate of any consumer-facing technology in history. Healthcare, a field that traditionally uses NLP techniques, was bound to be affected by this meteoric rise. In this paper, we gauge the extent of the impact by evaluating the performance of LLMs for the task of medical coding on real-life noisy data. We conducted several experiments on MIMIC III and IV datasets with encoder-based LLMs, such as BERT. Furthermore, we developed Segmented Harmonic Loss, a new loss function to address the extreme class imbalance that we found to prevail in most medical data in a multi-label scenario by segmenting and decoupling co-occurring classes of the dataset with a new segmentation algorithm. We also devised a technique based on embedding similarity to tackle noisy data. Our experimental results show that when trained with the proposed loss, the LLMs achieve significant performance gains even on noisy long-tailed datasets, outperforming the F1 score of the state-of-the-art by over ten percentage points.