MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
作者: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
分类: cs.CV, cs.LG
发布日期: 2026-07-08
💡 一句话要点
提出MedPMC框架以解决医疗多模态数据不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 医疗多模态 数据处理 自动化框架 医学图像 临床验证 基础模型 数据集构建
📋 核心要点
- 现有多模态基础模型受限于高质量临床数据的缺乏,影响了模型的有效性和可靠性。
- MedPMC框架通过自动化处理和持续更新,将PMC文献转化为高保真的医学图文数据,解决了数据不足的问题。
- 在多个基准测试中,MedPMC训练的模型在零样本AUC和医学视觉问答任务中均显著提升了性能,验证了其有效性。
📝 摘要(中文)
医学本质上是多模态的,临床医生需要综合来自不同数据流的信息。然而,现有多模态基础模型的发展受限于高质量临床数据的获取。尽管PubMed Central(PMC)提供了专家撰写的图文数据,但现有的PMC衍生资源在保真度、可重复性和临床验证方面仍然有限。本文提出了MedPMC,一个自动化、可持续更新的框架,将许可文献转化为高保真医疗多模态模型基础设施。MedPMC对610万篇PMC文章进行了处理,策划了1100万对医学图文数据。实验结果显示,MedPMC在多个评估指标上表现优异,显著提升了医疗多模态基础模型的性能。
🔬 方法详解
问题定义:本文旨在解决医疗领域多模态基础模型所需的高质量临床数据不足的问题。现有的PMC衍生资源在保真度和临床验证方面存在明显不足,限制了模型的应用。
核心思路:MedPMC框架通过自动化处理和持续更新,将大量的医学文献转化为高保真的图文数据,提供了丰富的训练数据,增强了模型的学习能力和应用效果。
技术框架:MedPMC的整体架构包括文献抓取、图文对齐、图像分类和数据验证等多个模块。首先从PMC抓取文献,然后提取图文数据,最后进行分类和验证,确保数据的高质量。
关键创新:MedPMC的主要创新在于其自动化和持续更新的能力,能够不断从最新的医学文献中提取高质量数据,与传统静态数据集相比,具有更高的时效性和相关性。
关键设计:在数据处理过程中,MedPMC采用了多种先进的算法进行图文对齐和分类,使用了特定的损失函数来优化模型性能,并通过手动审核确保数据的医学相关性。
🖼️ 关键图片
📊 实验亮点
在实验中,MedPMC训练的CLIP风格模型在26个基准测试中,平均零样本AUC提升了7.1个百分点,且使用的图文对数量不到传统基线的一半。此外,在医学视觉问答任务中,模型的表现提升了1.9和16.9个百分点,显示出MedPMC在实际应用中的显著优势。
🎯 应用场景
MedPMC框架的潜在应用领域包括医学影像分析、临床决策支持系统和医疗教育等。通过提供高质量的多模态数据,MedPMC能够帮助研究人员和临床医生更好地理解和应用医学知识,推动医疗人工智能的发展。未来,随着数据的不断更新,MedPMC有望在更多医学领域发挥重要作用。
📄 摘要(原文)
Medicine is inherently multimodal, requiring clinicians to synthesize information across diverse data streams. Yet the development of multimodal foundation models is constrained by limited access to large-scale, high-quality clinical data. Although PubMed Central (PMC) offers a complementary source of expert-authored image-text data, existing PMC-derived resources remain limited in fidelity, reproducibility, and clinical validation. We introduce MedPMC, an automated, continuously updatable framework that transforms permissively licensed literature into high-fidelity infrastructure for medical multimodal models. Applied to 6.1 million PMC articles, MedPMC curated 11 million medical image-text pairs. Component evaluations showed strong performance for initial screening (F1 = 93.2), multi-panel figure detection (F1 = 96.5), figure separation (mAP = 89.8), caption separation and alignment (F1 = 81.4; ROUGE-L = 85.3), and medical figure classification (F1 = 96.5). Manual review by five annotators, three with medical training, found 95.3% of MedPMC images medically relevant, versus 19.7% in a prior PMC-derived dataset. Across 26 benchmarks spanning 11 specialties, a MedPMC-trained CLIP-style model improved average zero-shot AUC by 7.1 percentage points over the strongest architecture-matched biomedical CLIP baseline despite using fewer than half as many image-text pairs. As the vision encoder in a multimodal large language model, it improved medical visual question-answering by 1.9 and 16.9 percentage points across two benchmarks. In 10,524 Yale New Haven Health System dermatology photographs, it improved morphology-to-image retrieval Recall@5 by 11.7 percentage points. These findings show that high-fidelity literature curation strengthens medical multimodal foundation models across benchmark and clinical settings. We publicly release the framework, corpus, benchmarks, and pretrained models.