GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting
作者: Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao
分类: cs.CV
发布日期: 2026-07-13
💡 一句话要点
提出GFR-SAM以解决训练依赖的伪装目标检测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 伪装目标检测 无监督学习 图像分割 深度学习 计算机视觉
📋 核心要点
- 现有的伪装目标检测方法依赖大量标注数据,且无监督方法对定位误差敏感,限制了其应用。
- 本文提出GFR-SAM,通过生成、过滤和精炼的三阶段流程,解决了传统方法的脆弱性,提升了检测精度。
- 在R2C7K基准测试中,GFR-SAM在加权F-measure上提升8.7%,显示出与监督方法的竞争力。
📝 摘要(中文)
伪装目标检测(Ref-COD)需要根据参考线索对隐藏目标进行分割。现有的监督方法依赖大量标注,而基于稀疏点提示的无监督方法对定位误差敏感。为此,本文提出GFR-SAM,一个稳健的三阶段无监督框架。GFR-SAM将方法从脆弱的点匹配转变为“生成-过滤-精炼”的流程。首先,引入上下文示例引导分割,利用跨图像推理生成候选掩码。其次,区域-全局对比过滤模块通过DINOv3原型对齐对候选进行排名,有效抑制背景干扰。最后,几何-语义精炼模块结合边界框和文本提示,恢复细粒度边界并增强实例召回。在R2C7K基准测试中,GFR-SAM在加权F-measure($F_β^w$)上超越现有无监督方法8.7%,并与监督的最先进方法竞争。此研究展示了释放SAM3潜力的可能性,为无监督任务提供了稳健的解决方案。
🔬 方法详解
问题定义:本文旨在解决伪装目标检测中的标注依赖性和定位误差问题。现有方法往往需要大量标注数据,且无监督方法在处理复杂场景时表现不佳。
核心思路:GFR-SAM的核心思路是通过“生成-过滤-精炼”的流程,利用上下文示例引导分割,减少对标注的依赖,同时提升检测的准确性和鲁棒性。
技术框架:GFR-SAM的整体架构分为三个主要模块:1) 上下文示例引导分割,2) 区域-全局对比过滤,3) 几何-语义精炼。该流程通过跨图像推理生成候选掩码,并对其进行过滤和精细化处理。
关键创新:GFR-SAM的创新在于引入了上下文示例引导分割和区域-全局对比过滤模块,显著提升了候选掩码的质量和准确性,克服了传统方法的局限性。
关键设计:在设计中,采用DINOv3进行原型对齐,确保候选掩码的有效性;同时结合边界框和文本提示,增强了细粒度边界的恢复能力。
🖼️ 关键图片
📊 实验亮点
GFR-SAM在R2C7K基准测试中表现出色,超越现有无监督方法8.7%的加权F-measure($F_β^w$),并与监督的最先进方法相竞争,展示了其在伪装目标检测中的有效性和优势。
🎯 应用场景
GFR-SAM的研究成果在多个领域具有潜在应用价值,如自动驾驶、监控系统和军事侦察等。通过提供一种无监督的伪装目标检测方法,该技术能够在缺乏标注数据的情况下,提升目标识别的准确性和效率,具有广泛的实际意义。
📄 摘要(原文)
Referring Camouflaged Object Detection (Ref-COD) requires segmenting hidden targets guided by reference cues. While supervised methods are annotation-heavy and training-free approaches via sparse point-prompting are sensitive to localization errors, we propose GFR-SAM, a robust three-stage training-free framework. GFR-SAM shifts the paradigm from fragile point-matching to a "Generate-Filter-Refine" pipeline. First, we introduce In-Context Exemplar-guided Segmentation, empowering SAM3 with cross-image inference to generate candidate masks via holistic visual exemplars, bypassing its native intra-image constraints. Second, a Region-Global Contrastive Filtering module ranks candidates through DINOv3-based prototypical alignment, effectively suppressing background distractors. Finally, a Geometric-Semantic Refinement module synergizes bounding box and text prompts to recover fine-grained boundaries and enhance instance recall. Evaluated on the R2C7K benchmark, GFR-SAM outperforms existing training-free methods by 8.7\% in weighted F-measure ($F_β^w$) and competes with supervised state-of-the-art counterparts. Ultimately, this work underscores the potential of unlocking SAM3's latent capability for cross-image In-Context prompting, establishing a robust, training-free paradigm that effectively bridges the gap between general-purpose foundation models and specialized, label-intensive perception tasks without the need for task-specific fine-tuning.