DINO-Med: A Unified Patch-Based Adaptation Framework for Multi-Modal Medical Image Analysis Applied to Liver Fibrosis Staging

📄 arXiv: 2609.11380v1 📥 PDF

作者: Boya Wang, Ruizhe Li, Chao Chen, Xin Chen

分类: cs.CV

发布日期: 2026-09-10

备注: 12 pages, 2 figures. Accepted by AIiH


💡 一句话要点

提出DINO-Med框架以解决多模态医学影像分析问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态医学影像 肝纤维化分期 DINOv3 补丁提取 无训练配准 自动定位 特征聚合

📋 核心要点

  1. 现有方法在将自然图像模型应用于多模态医学影像时,面临显著的领域差距和适应性挑战。
  2. 本文提出了一种基于补丁的统一框架,通过无训练的配准和自动定位来处理多模态影像。
  3. 在360名受试者的实验中,DINOv3框架在肝纤维化分期任务中取得了78.4%的最佳分类准确率。

📝 摘要(中文)

将自然图像基础模型如DINOv3适应于多模态医学影像分析面临显著的领域差距挑战。本文提出了一种统一的基于补丁的框架,通过无训练的配准、自动定位和掩膜过滤的补丁提取处理原始多模态影像。该架构采用分层策略,将补丁级别的见解汇聚为受试者级别的诊断。以肝纤维化分期为案例,评估了手工Radiomics特征、学习的ResNet特征、预训练基础模型SAM-Med2D特征和冻结的DINOv3特征四种补丁级特征表示。实验结果显示,DINOv3框架在肝纤维化检测和肝硬化分期中显著优于所有基线模型。

🔬 方法详解

问题定义:本文旨在解决将自然图像基础模型适应于多模态医学影像分析中的领域差距问题。现有方法在处理多通道医学扫描时,往往无法有效提取有用特征,导致分类性能不足。

核心思路:提出的框架通过无训练的配准、自动定位和掩膜过滤的补丁提取,旨在高效处理多模态影像并聚合补丁级特征,以实现更准确的诊断。

技术框架:整体架构包括三个主要模块:1) 无训练的配准模块,确保不同模态影像的对齐;2) 自动定位模块,快速识别感兴趣区域;3) 掩膜过滤的补丁提取模块,提取有效的补丁特征。最终通过分层策略将补丁级特征汇聚为受试者级别的诊断结果。

关键创新:最重要的技术创新在于无训练的配准和掩膜过滤的补丁提取方法,这与传统的需要大量标注数据的训练方法形成鲜明对比,使得框架在数据稀缺的医学领域具有更好的适应性。

关键设计:在实验中,所有模型均使用相同的轻量级MLP头,并在刚性和可变形配准设置下进行评估。特别关注轻度纤维化(S1)和肝硬化(S4)类别,确保分类器能够有效处理这两种情况。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在360名受试者的实验中,DINOv3框架在肝纤维化分期任务中取得了78.4%的最佳分类准确率,肝硬化分期任务中达到75.8%。这些结果显著优于所有基线模型,展示了该框架的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括医学影像分析、肝病诊断和个性化医疗。通过提高肝纤维化和肝硬化的检测准确性,该框架可为临床医生提供更可靠的决策支持,推动医学影像分析技术的发展。

📄 摘要(原文)

Adapting natural-image foundation models like DINOv3 to multi-modal medical imaging is challenging due to the significant domain gap between natural color images and multi-channel medical scans. We present a unified, patch-based framework that processes raw multimodal imaging through training-free registration, automated localization, and mask-filtered patch extraction. This architecture culminates in a hierarchical strategy that aggregates patch-level insights into subject-level diagnostics. Using liver fibrosis staging as a case study, we evaluate four patch-level feature representations: handcrafted Radiomics features, learned ResNet features, pre-trained foundation model SAM-Med2D features, and frozen DINOv3 features. To ensure a controlled comparison, all models utilize the same lightweight MLP head and are evaluated across both rigid and deformable registration settings. Our training protocol focuses on mild fibrosis (S1) and cirrhosis (S4) classes only, enabling a single classifier to address both substantial fibrosis detection and cirrhosis staging. Evaluated via 10 random train (90%)/ test (10%) splits on 360 subjects from the CARE 2025 Liver Track 4 cohort, our DINOv3-based framework significantly outperforms all baselines, achieving the best classification accuracy of 78.4% for S1 and 75.8% for S4.