LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models
作者: Gangsu Kim, Won-Ki Jeong
分类: cs.CV, cs.LG
发布日期: 2026-07-13
🔗 代码/项目: GITHUB
💡 一句话要点
提出LaGuadia框架以解决病理图像模型蒸馏效率问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 病理图像 知识蒸馏 多教师模型 临床语言 视觉-语言对齐 自适应蒸馏 数字病理学 模型压缩
📋 核心要点
- 现有的病理基础模型在计算效率上存在显著挑战,尤其是在处理全幻灯片图像时。
- LaGuadia框架通过临床语言指导,动态整合多个病理基础模型的知识,提升了知识蒸馏的效果。
- 实验结果显示,LaGuadia模型在多个任务上表现优异,参数量显著减少,且性能超过了现有的基础模型。
📝 摘要(中文)
病理基础模型(PFMs)提供了强大的全幻灯片图像(WSI)表示,但计算成本高昂。虽然知识蒸馏(KD)可以创建高效的学生模型,但现有的多教师方法通常采用次优的均匀加权,忽视了组织异质性。我们提出了LaGuadia(语言引导的自适应蒸馏)框架,通过临床语言指导动态整合多个PFMs的专业知识,从而开发出紧凑的病理图像编码器。该方法首先从病理报告中提取可视的临床关键词,然后通过视觉-语言元教师(MedSigLIP)将视觉特征与这些关键词对齐,提供密集的语义指导,最后进行自适应KD,根据教师与临床叙述的语义对齐程度加权教师贡献。实验结果表明,87M参数的LaGuadia学生模型在WSI标题生成、视觉问答和幻灯片级分类任务中表现出色,达到或超过了基础规模模型如GigaPath和UNI,展现出强大的事实一致性和鲁棒性。代码可在https://github.com/hvcl/LaGuadia获取。
🔬 方法详解
问题定义:本论文旨在解决病理基础模型(PFMs)在全幻灯片图像(WSI)处理中的高计算成本问题。现有的多教师知识蒸馏方法往往采用均匀加权,未能充分考虑组织的异质性,导致模型性能不佳。
核心思路:LaGuadia框架通过提取病理报告中的临床关键词,并利用视觉-语言元教师(MedSigLIP)对视觉特征进行语义对齐,从而实现动态加权的知识蒸馏。这种设计使得教师模型的贡献能够根据其与临床叙述的语义一致性进行调整。
技术框架:该方法包括多个阶段:首先从病理报告中提取临床关键词;其次,通过MedSigLIP对视觉特征与关键词进行对齐;最后,进行自适应知识蒸馏,动态调整教师模型的权重。
关键创新:LaGuadia的主要创新在于引入临床语言作为语义锚点,通过动态加权机制提升了知识蒸馏的效果。这一方法与传统的均匀加权策略形成鲜明对比,能够更好地适应组织的异质性。
关键设计:在技术细节上,LaGuadia采用了多阶段的处理流程,关键参数设置包括教师模型的选择和权重调整机制,损失函数设计考虑了语义对齐的影响,确保了模型的高效性与准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,LaGuadia模型在多个任务上表现优异,87M参数的学生模型在WSI标题生成、视觉问答和幻灯片级分类任务中,性能达到或超过了基础规模模型如GigaPath和UNI,展现出强大的事实一致性和鲁棒性,显著提升了模型的实用性。
🎯 应用场景
该研究的潜在应用领域包括数字病理学、医学影像分析和临床决策支持系统。通过提高病理图像处理的效率和准确性,LaGuadia框架能够为临床医生提供更可靠的辅助工具,推动个性化医疗的发展。未来,该方法还可能扩展到其他医学影像领域,提升整体医疗服务质量。
📄 摘要(原文)
Pathology Foundation Models (PFMs) offer powerful Whole Slide Image (WSI) representations but suffer from massive computational costs. While Knowledge Distillation (KD) can create efficient student models, existing multi-teacher methods often use suboptimal uniform weighting that ignores tissue heterogeneity. We propose LaGuadia (Language-Guided Adaptive DistillAtion), a framework that develops a compact pathology image encoder by dynamically integrating expertise from multiple PFMs under clinical linguistic guidance. Our approach utilizes a multi-stage pipeline: first, extracting visually observable clinical keywords from pathology reports; second, aligning visual features with these keywords via a Vision-Language meta-teacher (MedSigLIP) to provide dense semantic guidance; and finally, performing adaptive KD where teacher contributions are weighted based on their semantic alignment with the clinical narrative. Experiments on WSI captioning, visual question answering, and slide-level classification tasks demonstrate that an 87M parameter LaGuadia student model matches or exceeds foundation-scale models such as GigaPath and UNI, achieving strong factual consistency and robust generalization. These results highlight clinical language as an effective semantic anchor for building efficient and reliable digital pathology systems. Code is available at https://github.com/hvcl/LaGuadia.