Vision Foundation Models in Radiology: A Scoping Review of Data, Methodology, Evaluation and Clinical Translation

📄 arXiv: 2607.07219v1 📥 PDF

作者: Alejandro Vergara-Richart, Xavier Rafael-Palou, Almudena Fuster-Matanzo, Ignacio Iborra Roncales, Ángel Alberich-Bayarri, Ana Jiménez-Pastor

分类: cs.CV, cs.AI, cs.LG

发布日期: 2026-07-08

备注: 33 pages, 8 tables, 2 figures


💡 一句话要点

综述放射学中的视觉基础模型,提升临床应用潜力

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉基础模型 放射学 数据异质性 自监督学习 迁移学习 模型评估 临床应用

📋 核心要点

  1. 现有放射学影像模型在定义、开发和评估上存在异质性,影响了其临床应用的有效性。
  2. 本研究通过范围审查,系统分析了放射学领域的视觉基础模型,重点关注数据、方法和评估标准。
  3. 研究结果表明,尽管放射学VFMs具有良好的迁移能力,但临床转化仍面临多重挑战。

📝 摘要(中文)

视觉基础模型(VFMs)在放射影像领域的开发日益增多,但其定义、开发和评估仍存在异质性。我们进行了PRISMAScR范围审查,涵盖2017年1月至2026年3月间发表的同行评审研究,重点描述专门在放射影像数据上训练的基础模型。共纳入67项研究,分为数据规模与异质性、架构与预训练可扩展性、下游迁移与泛化三大支柱。数据集主要涉及脑MRI、胸腹部CT和胸部X光,样本量从不足10万到数百万不等。以Transformer架构和自监督预训练为主,尤其是掩蔽图像建模、对比学习和多阶段方法。评估主要集中在分割和分类上,而跨中心、跨扫描仪、解剖和模态转移验证则报告不一致。整体而言,放射学特定的VFMs显示出良好的迁移能力,但临床转化受到数据代表性不足、基准不一致、报告不完整和缺乏部署导向评估的限制。

🔬 方法详解

问题定义:本论文旨在解决放射学领域视觉基础模型(VFMs)在定义、开发和评估上的异质性问题。现有方法在数据代表性、基准不一致和评估报告不完整等方面存在痛点,限制了其临床应用的有效性。

核心思路:通过系统的范围审查,论文提出了对放射学VFMs的全面分析框架,涵盖数据规模、模型架构和评估方法,以促进其临床转化和应用。

技术框架:研究将67项相关文献分为三个主要支柱:数据规模与异质性、架构与预训练可扩展性、下游迁移与泛化。每个支柱下又细分为具体的研究方向和方法。

关键创新:本研究的创新在于系统性地整合了放射学VFMs的研究现状,提出了一个全面的评估框架,强调了数据和模型架构的多样性对临床应用的重要性。

关键设计:研究中涉及的关键设计包括使用Transformer架构和自监督学习方法,特别是掩蔽图像建模和对比学习。同时,评估方法主要集中在分割和分类任务上,跨中心和跨模态验证的报告则显得不够一致。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

研究显示,放射学VFMs在迁移能力上表现出色,尤其是在脑MRI和胸部X光影像的应用中。然而,临床转化受到数据代表性不足和评估标准不一致的限制,亟需进一步的研究和改进。

🎯 应用场景

该研究为放射学领域的视觉基础模型提供了系统的评估框架,具有重要的实际价值。通过提升模型的迁移能力和临床适应性,未来可在疾病诊断、影像分析等多个应用场景中发挥重要作用,推动放射学的智能化进程。

📄 摘要(原文)

Vision foundation models (VFMs) are increasingly being developed for radiological imaging, yet their definition, development and evaluation remain heterogeneous. We conducted a PRISMAScR scoping review of peer-reviewed studies published between January 2017 and March 2026 describing foundation models trained exclusively on radiological imaging data. Sixty-seven studies were included and mapped across three pillars: data scale and heterogeneity, architectural and pretraining scalability, and downstream transferability and generalization. Datasets primarily covered brain MRI, thoracoabdominal CT, and chest X-ray, ranging from fewer than 100,000 samples to multi-million-image cohorts. Transformer-based architectures and self-supervised pretraining predominated, particularly masked image modeling, contrastive learning and multi-stage approaches. Evaluation focused mainly on segmentation and classification, whereas cross-center, cross-scanner, anatomical and modality-shift validation was inconsistently reported. Alignment with FUTURE-AI principles was uneven. Overall, radiology-specific VFMs show promising transferability, but clinical translation remains constrained by limited data representativeness, heterogeneous benchmarks, incomplete reporting and insufficient deployment-oriented evaluation.