BrainNext: A General-Purpose Self-Supervised Foundation Model for Brain MRI Analysis

📄 arXiv: 2607.17782v1 📥 PDF

作者: Moona Mazher, Abdul Qayyum, Steven A. Niederer, Daniel C. Alexander

分类: cs.CV, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出BrainNext以解决脑MRI分析中的通用性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自监督学习 脑MRI分析 基础模型 迁移学习 医学影像 深度学习 三维网络 解剖表示

📋 核心要点

  1. 现有的神经影像基础模型受限于任务特定训练和小规模数据集,难以实现广泛的应用。
  2. BrainNext通过结合掩码自编码器和三维双向xLSTM-UNet架构,利用大规模无标签数据进行自监督学习。
  3. 在FOMO 2025挑战中,BrainNext在多个任务中表现优异,特别是在脑膜瘤分割任务中排名第一,展示了其强大的迁移能力。

📝 摘要(中文)

使用自监督学习预训练的基础模型已在计算机视觉领域带来了转变,能够从大规模无标签数据中学习可迁移的表示。然而,现有的神经影像基础模型因任务特定训练、基于切片的学习策略或相对较小的预训练数据集而限制了其在多样化脑MRI应用中的通用性。本文提出了BrainNext,一个用于体积脑MRI分析的通用自监督基础模型。BrainNext结合了掩码自编码器(MAE)预训练和原生三维双向xLSTM-UNet架构,从60,551个无标签脑MRI检查中学习丰富的解剖表示。预训练模型随后通过轻量级的任务特定微调适应下游任务。我们在2025年医学影像基础模型(FOMO)方法赛道上评估了BrainNext,在分类、分割和脑龄估计任务中取得了第二名的整体成绩,并在脑膜瘤分割任务中排名第一,展示了其在异构神经影像任务中的强大可迁移性。这些结果突显了大规模自监督预训练在学习稳健和可迁移的体积表示方面的潜力,确立了BrainNext作为多样化脑MRI应用的可扩展基础模型。

🔬 方法详解

问题定义:本文旨在解决现有脑MRI分析模型在通用性和可迁移性方面的不足,现有方法多依赖于特定任务训练和小规模数据集,限制了其应用范围。

核心思路:论文提出的BrainNext模型通过自监督学习和大规模无标签数据的结合,旨在学习丰富的解剖表示,从而提高模型的通用性和适应性。

技术框架:BrainNext的整体架构包括掩码自编码器(MAE)预训练阶段和三维双向xLSTM-UNet网络结构,能够有效处理体积数据。预训练后,模型通过轻量级微调适应不同的下游任务。

关键创新:BrainNext的主要创新在于结合了自监督学习和三维网络架构,能够从大规模无标签数据中学习到更为通用的表示,与传统的任务特定模型相比,显著提升了模型的迁移能力。

关键设计:在设计中,采用了掩码自编码器作为预训练策略,并使用了三维双向xLSTM-UNet作为基础网络结构,确保了模型在处理体积数据时的有效性和准确性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在FOMO 2025挑战中,BrainNext在分类、分割和脑龄估计任务中取得了第二名的整体成绩,并在脑膜瘤分割任务中排名第一,展示了其在异构神经影像任务中的强大可迁移性,证明了大规模自监督预训练的有效性。

🎯 应用场景

BrainNext模型在脑MRI分析中的潜在应用广泛,包括脑肿瘤检测、脑结构分析和脑龄估计等。其强大的迁移能力使其能够适应不同的医学影像任务,未来可能推动个性化医疗和早期疾病诊断的发展。

📄 摘要(原文)

Foundation models pretrained using self-supervised learning have transformed computer vision by learning transferable representations from large-scale unlabeled data. However, existing foundation models for neuroimaging remain limited by task-specific training, slice-based learning strategies, or relatively small pretraining datasets, restricting their generalizability across diverse brain MRI applications. In this work, we present BrainNext, a general-purpose self-supervised foundation model for volumetric brain MRI analysis. BrainNext combines masked autoencoder (MAE) pretraining with a native three-dimensional Bi-Directional xLSTM-UNet architecture to learn rich anatomical representations from 60,551 unlabeled brain MRI examinations spanning multiple MRI modalities. The pretrained model is subsequently adapted to downstream tasks through lightweight task-specific fine-tuning. We evaluate BrainNext on the Foundation Models for Medical Imaging (FOMO) 2025 Method Track, encompassing classification, segmentation, and brain-age estimation, where it achieved second place overall and ranked first in the meningioma segmentation task on the official FOMO 2025 challenge leaderboard, demonstrating strong transferability across heterogeneous neuroimaging tasks. These results highlight the potential of large-scale self-supervised pretraining to learn robust and transferable volumetric representations, establishing BrainNext as a scalable foundation model for diverse brain MRI applications.