Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks
作者: Wenhao Zhang, Zhongliang Zhou, John Kang, Sheng Li
分类: cs.CV, cs.LG
发布日期: 2026-07-14
💡 一句话要点
审计多模态基准中的数据泄露问题以提升WSI VQA评估准确性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 数据泄露 视觉语言模型 全切片图像 视觉问答 基准评估 计算病理学 多模态推理
📋 核心要点
- 现有的视觉语言模型在WSI VQA基准上表现出色,但存在严重的数据泄露问题,影响评估的真实性。
- 论文通过审计数据泄露,提出了对基准构建、来源披露和自动重叠审计的具体建议,以确保评估的无污染性。
- 研究发现,TCGA衍生基准的案例级训练测试重叠高达92.3%至100%,且泄露特征可导致准确性差距,影响模型评估结果。
📝 摘要(中文)
近年来,视觉语言模型在全切片图像(WSI)视觉问答(VQA)基准上表现出色,但我们发现这些结果受到数据泄露的严重影响,包括患者级和机构级的泄露。通过追踪主要公共资源中的标识符,我们记录到TCGA衍生基准的案例级训练测试重叠高达92.3%至100%。此外,泄露的特征在基础模型特征空间中是线性可解的,导致泄露案例与审计清洁案例之间存在可测量的准确性差距。因此,当前的WSI VQA评估无法区分真实的多模态推理与对记忆中机构和患者特定伪影的最近邻检索。我们提出了具体的无污染评估建议,以指导未来研究的可验证进展。
🔬 方法详解
问题定义:论文要解决的问题是当前WSI VQA评估中存在的数据泄露问题,尤其是患者级和机构级的泄露,这导致模型评估结果不准确。现有方法未能有效识别和消除这些泄露,影响了研究的可信度。
核心思路:论文的核心思路是通过审计现有基准,识别数据泄露的来源,并提出改进建议,以确保评估的准确性和可靠性。通过追踪标识符,揭示数据泄露的程度和影响。
技术框架:整体架构包括数据审计、泄露识别和评估改进三个主要模块。首先,通过分析公共资源中的标识符,识别患者和机构级的泄露;其次,评估泄露对模型性能的影响;最后,提出改进评估方法的建议。
关键创新:最重要的技术创新点在于系统性地审计和量化数据泄露的影响,揭示了现有评估方法的不足之处,并提出了针对性的改进措施。这与传统方法的评估方式有本质区别。
关键设计:在研究中,采用了特定的标识符追踪方法,结合线性可解的特征空间分析,评估泄露对模型准确性的影响。关键参数设置和损失函数设计确保了评估的有效性和可靠性。通过这些设计,论文能够准确识别和量化数据泄露的影响。
🖼️ 关键图片
📊 实验亮点
实验结果显示,TCGA衍生基准的案例级训练测试重叠高达92.3%至100%,并且泄露特征在基础模型特征空间中是线性可解的。研究还发现,泄露案例与审计清洁案例之间存在显著的准确性差距,影响了多个已发布WSI VLM的性能评估。
🎯 应用场景
该研究的潜在应用领域包括计算病理学、医学影像分析和机器学习基准评估。通过确保评估的无污染性,研究能够提升模型的可信度,推动相关领域的进步,促进更可靠的多模态推理技术的发展。
📄 摘要(原文)
Recent vision-language models (VLMs) for computational pathology report striking zero-shot performance on whole-slide image (WSI) visual question answering (VQA) benchmarks. We audit these claims and find them fundamentally compromised by data leakage at two hierarchical levels: patient-level leakage, where slides from the same case appear in both training and test folds, and institutional-level leakage, where different cases nonetheless share staining-batch and scanner signatures through a common Tissue Source Site (TSS). By tracing canonical slide, case, and TSS identifiers across major public resources, we document case level train test overlaps of 92.3~100% on TCGA-derived benchmarks, together with near-complete TSS overlap. We further demonstrate that both leakage levels are linearly decodable from foundation-model feature space, that they induce a measurable accuracy gap between leaked and audit-clean cases on a published checkpoint, and that across multiple published WSI VLMs, peak reported accuracies concentrate on the most heavily contaminated benchmarks. Therefore, the current WSI VQA evaluation cannot distinguish genuine multimodal reasoning from nearest-neighbor retrieval over memorized institutional and patient-specific artifacts. Finally, we outline concrete recommendations for contamination-free evaluation. By addressing benchmark construction, provenance disclosure, and automated overlap auditing, we aim to guide future research toward verifiable claims of progress.