LLM4CKD: Large Language Models for Early Stage Chronic Kidney Disease Screening

📄 arXiv: 2609.04013v2 📥 PDF

作者: Muhammad Ashad Kabir, Sirajam Munira

分类: cs.AI, cs.LG

发布日期: 2026-09-03 (更新: 2026-09-04)

备注: Accepted at ICDM 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出LLM4CKD以解决慢性肾病早期筛查问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 慢性肾病 大型语言模型 早期筛查 机器学习 深度学习 数据效率 临床应用

📋 核心要点

  1. 现有的机器学习和深度学习方法在慢性肾病筛查中依赖大量标注数据,限制了其实际应用。
  2. 本研究提出了一种利用大型语言模型进行CKD筛查的框架,采用结构化提示模板和临床特征,避免了特定任务训练。
  3. 实验结果显示,LLMs在低数据环境下的表现与传统方法相当,且在某些情况下超越了它们,但稳定性较低。

📝 摘要(中文)

慢性肾病(CKD)的早期筛查对于及时干预至关重要,但现有的机器学习(ML)和深度学习(DL)方法通常需要标注数据和模型训练,限制了其在实际筛查中的应用。本研究评估了大型语言模型(LLMs)在零-shot和少-shot上下文学习设置下的CKD筛查效果,并与传统的ML和DL方法进行了比较。我们提出了一个框架,利用临床选择的表格特征和结构化提示模板,使LLM能够在没有特定任务训练的情况下进行推理。结果表明,LLMs在低数据设置下能够以少量示例实现竞争性能,常常与传统方法相匹配或超越。然而,LLMs的性能依赖于模型,且在输入复杂性增加时稳定性较差。总体而言,研究结果强调了数据效率与稳定性之间的权衡,表明LLMs在标注数据有限时可作为CKD筛查的灵活补充方法。

🔬 方法详解

问题定义:本研究旨在解决慢性肾病(CKD)早期筛查中对标注数据和模型训练的依赖问题。现有的机器学习和深度学习方法在实际应用中面临数据稀缺的挑战。

核心思路:本研究的核心思路是利用大型语言模型(LLMs)进行CKD筛查,通过结构化提示和临床特征实现推理,而无需进行特定任务的训练,从而提高数据利用效率。

技术框架:整体架构包括数据预处理、特征选择、提示模板设计和模型推理四个主要模块。首先,选择临床相关的表格特征,然后设计多种提示模板以适应不同的输入格式,最后通过LLMs进行推理。

关键创新:最重要的技术创新在于将LLMs应用于CKD筛查,展示了其在低数据环境下的有效性,与传统的ML和DL方法相比,提供了一种新的灵活性和适应性。

关键设计:关键设计包括选择适当的临床特征、构建多样化的提示模板,以及在不同数据设置下评估模型性能。实验中还考虑了不同的提示风格和特征配置,以优化LLM的推理效果。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,LLMs在低数据设置下的表现与传统机器学习和深度学习方法相当,甚至在某些情况下超越了它们。具体而言,LLMs在少量示例的情况下实现了竞争性能,展示了其在CKD筛查中的潜力。然而,随着输入复杂性的增加,LLMs的性能稳定性有所下降。

🎯 应用场景

该研究的潜在应用领域包括医疗健康,特别是在慢性肾病的早期筛查中。通过利用大型语言模型,能够在缺乏大量标注数据的情况下,提供有效的筛查工具,帮助医生进行早期干预,降低CKD的发病率。未来,该方法可能扩展到其他疾病的筛查和诊断中,具有广泛的实际价值。

📄 摘要(原文)

Early screening of chronic kidney disease (CKD) is critical for timely intervention, yet most machine learning (ML) and deep learning (DL) approaches require labeled data and model training, limiting their use in real-world screening settings. This study evaluates the effectiveness of large language models (LLMs) for CKD screening under zero-shot and few-shot in-context learning settings and compares them with traditional ML and DL methods. We propose a framework that uses clinically selected tabular features and structured prompt templates to enable LLM-based inference without task-specific training. LLM performance is evaluated across multiple prompt styles, feature configurations, and data settings, and compared with standard ML, DL, and tabular foundation model (TFM) baselines, and existing CKD screening tools. The results show that LLMs can achieve competitive performance using only a small number of examples, often matching or outperforming traditional approaches in low-data settings. However, their performance remains model-dependent and less stable as input complexity increases. In contrast, ML, DL, and TFM models show more consistent improvement with larger training data. Overall, the findings highlight a trade-off between data efficiency and stability, suggesting that LLMs may serve as a flexible complementary approach for CKD screening when labeled data are limited. To facilitate further research and reproducibility, the code has been made publicly available at https://github.com/akabircs/LLM4CKD