WSPolypNet: Weakly Supervised Polyp Localization in Colonoscopy Videos

📄 arXiv: 2609.08182v1 📥 PDF

作者: Giseong Hwang, Minjae Jo, Yeonghyeon Park, Kyeonghun Kim, Seoyeon Han, Donghoon Han, Haneul Kim, Yului Jeong, Insung Hwang, Pa Hong, Ken Ying-Kai Liao, Nam-Joon Kim

分类: cs.CV, cs.AI

发布日期: 2026-09-08


💡 一句话要点

提出WSPolypNet以解决结肠镜视频中多发性息肉定位问题

🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)

关键词: 弱监督学习 息肉定位 结肠镜视频 类激活图 3D卷积神经网络 多视角策略 医疗影像分析

📋 核心要点

  1. 现有方法在结肠镜视频中需要密集的帧级标注,成本高且效率低,限制了其应用。
  2. WSPolypNet通过3D卷积神经网络和视频级标签生成类激活图,提出了一种弱监督的息肉定位方法。
  3. 实验结果显示,WSPolypNet在多视角设置下显著提高了息肉定位的准确性和召回率,尤其对小息肉的检测效果显著提升。

📝 摘要(中文)

由于结肠镜视频的密集帧级标注成本高昂,本文提出了一种弱监督框架WSPolypNet,仅使用视频级标签进行息肉定位。WSPolypNet采用3D卷积神经网络,通过视频级监督生成类激活图(CAM),识别候选息肉区域,而无需帧级空间标注。通过多视角策略增强CAM生成的定位线索,并将其提供给MedSAM2作为点提示,MedSAM2进一步传播分割掩码,依据息肉边界细化粗略的定位线索。WSPolypNet在IoU阈值为0.3、0.5和0.7时的CorLoc得分分别为47.80%、43.68%和35.01%,相比单视角设置的36.87%、33.72%和27.94%有显著提升。对于小息肉,多视角策略将CorLoc@0.5从16.01%提高至30.97%。该框架还实现了94.51%的召回率,展示了弱监督时空学习在减少结肠镜视频息肉定位空间标注需求方面的潜力。

🔬 方法详解

问题定义:本文旨在解决结肠镜视频中息肉定位的高成本问题,现有方法依赖于密集的帧级标注,导致效率低下和标注成本高昂。

核心思路:WSPolypNet通过弱监督学习,仅使用视频级标签,利用3D卷积神经网络生成类激活图(CAM),从而识别候选息肉区域,避免了对帧级标注的依赖。

技术框架:该框架主要包括三个模块:首先,使用3D卷积神经网络生成CAM;其次,采用多视角策略增强定位线索;最后,将这些线索提供给MedSAM2进行分割掩码的传播和细化。

关键创新:WSPolypNet的创新在于其弱监督学习的设计,能够在不需要帧级标注的情况下,利用视频级标签进行有效的息肉定位,显著降低了标注需求。

关键设计:在网络结构上,采用3D卷积神经网络以捕捉时空特征;损失函数设计为适应弱监督学习,确保模型能够从视频级标签中学习到有效的定位信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

WSPolypNet在多视角设置下的CorLoc得分显著提高,分别为47.80%、43.68%和35.01%,相比单视角设置的36.87%、33.72%和27.94%有明显提升。对于小息肉的检测,CorLoc@0.5从16.01%提升至30.97%,并实现了94.51%的召回率,展示了其在弱监督学习中的有效性。

🎯 应用场景

该研究具有广泛的应用潜力,尤其在医疗影像分析领域。通过减少对昂贵的帧级标注的依赖,WSPolypNet可以加速结肠镜视频的分析过程,提高息肉检测的效率和准确性,进而为临床诊断提供支持。未来,该方法还可能扩展到其他类型的医疗视频分析任务中。

📄 摘要(原文)

Because dense frame-level annotation of colonoscopy videos is costly, we propose WSPolypNet, a weakly supervised framework for polyp localization using only video-level labels. WSPolypNet employs a 3D convolutional neural network trained with video-level supervision to generate class activation maps (CAMs), which identify candidate polyp regions without requiring frame-level spatial annotations. The CAM-derived localization cues are further enhanced using a multi-view strategy and provided to MedSAM2 as point prompts. MedSAM2 then propagates segmentation masks across the video, refining the coarse localization cues according to polyp boundaries. WSPolypNet achieved CorLoc scores of 47.80%, 43.68%, and 35.01% at IoU thresholds of 0.3, 0.5, and 0.7, respectively, compared with 36.87%, 33.72%, and 27.94% in the single-view setting. For small polyps, the multi-view strategy improved CorLoc@0.5 from 16.01% to 30.97%. The framework also achieved a recall of 94.51%. These results demonstrate the potential of weakly supervised spatiotemporal learning to substantially reduce spatial annotation requirements for polyp localization in colonoscopy videos.