ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

📄 arXiv: 2607.09526v1 📥 PDF

作者: Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

分类: cs.CV, cs.AI

发布日期: 2026-07-10

🔗 代码/项目: GITHUB


💡 一句话要点

提出ALICE模型以整合多模态病理学知识

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 基础模型 聚合蒸馏 计算病理学 多模态学习 视觉语言 病理图像分析 知识整合

📋 核心要点

  1. 现有的基础模型在计算病理学中能力受限,导致不同专家知识的碎片化,影响模型的综合性能。
  2. ALICE模型通过多阶段聚合蒸馏,将多个视觉、视觉语言和幻灯片级教师模型的知识整合到一个统一的骨干网络中。
  3. 在多达21个任务场景的评估中,ALICE模型在任务匹配的病理基础模型中表现最佳,显示出其优越的综合能力。

📝 摘要(中文)

基础模型正在重塑计算病理学,但其能力仍受预训练目标、数据来源和空间尺度的影响,导致不同专家知识的碎片化。本文提出了ALICE,一个通过多阶段聚合蒸馏训练的统一基础模型,能够将八个视觉、视觉语言和幻灯片级教师模型的知识整合到单一骨干网络中。ALICE在24,985,184个切片级病理图像和155,604个高分辨率图像上进行预训练,并在21个任务场景、96个下游任务和48个数据源上进行评估,涵盖了感兴趣区域的组织分析、视觉语言多模态评估和全幻灯片临床评估。在所有三个评估设置中,ALICE在任务匹配的病理基础模型中获得了最佳平均排名。这些结果表明,聚合蒸馏能够将来自专业模型的互补能力整合到一个统一的骨干网络中,以支持广泛的计算病理学应用。

🔬 方法详解

问题定义:本文旨在解决现有基础模型在计算病理学中的能力受限和知识碎片化的问题。现有方法往往依赖于单一的预训练目标和数据来源,无法有效整合不同领域的专家知识。

核心思路:ALICE模型的核心思路是通过多阶段聚合蒸馏,将来自不同领域的教师模型的知识整合到一个统一的骨干网络中。这种设计旨在提升模型的综合性能,增强其在多种任务场景下的适应能力。

技术框架:ALICE的整体架构包括多个阶段的聚合蒸馏过程,首先从视觉模型、视觉语言模型和幻灯片级模型中提取知识,然后将这些知识整合到一个单一的骨干网络中。模型的训练数据包括大量的切片级和高分辨率病理图像。

关键创新:ALICE的主要创新在于其聚合蒸馏方法,能够有效整合来自不同模型的互补能力。这与现有方法的单一模型训练方式形成了鲜明对比,显著提升了模型的综合性能。

关键设计:在模型设计中,ALICE采用了多阶段的蒸馏策略,结合了不同类型的损失函数和网络结构,以确保知识的有效传递和整合。具体的参数设置和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

ALICE模型在21个任务场景中表现出色,获得了任务匹配的病理基础模型中的最佳平均排名,显示出其在96个下游任务和48个数据源上的优越性能。这一成果表明,聚合蒸馏方法有效提升了模型的综合能力。

🎯 应用场景

ALICE模型在计算病理学领域具有广泛的应用潜力,包括组织分析、临床评估和多模态数据处理等。其统一的骨干网络能够支持多种下游任务,提升病理图像分析的效率和准确性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Foundation models are reshaping computational pathology, yet their capabilities remain shaped by pretraining objectives, data sources, and spatial scales, fragmenting complementary expertise across separate backbones. Here we present ALICE, a unified foundation model trained through multi-stage agglomerative distillation that sequentially distills eight vision-only, vision-language, and slide-level teacher models into dedicated modules of a single backbone. ALICE is pretrained on 24,985,184 tile-level pathology images and 155,604 high-resolution images, and evaluated across 21 task scenarios, 96 downstream tasks, and 48 data sources, spanning region-of-interest tissue analysis, vision-language multimodal evaluation, and whole-slide clinical assessment. In all three evaluation settings, ALICE achieved the best average rank among task-matched pathology foundation models. These results demonstrate that agglomerative distillation can consolidate complementary capabilities from specialized models into a unified backbone for broad computational pathology applications. The model is available at https://github.com/WonderLandxD/ALICE.