DuoAD: Leveraging [CLS] Dual Characteristics for Training-Free Few-Shot Anomaly Detection
作者: Jyun-Ze Tang, Po-Han Huang, Ming-Ching Chang, Chih-Fan Hsu, Jeng-Lin Li
分类: cs.CV, cs.AI
发布日期: 2026-07-27
备注: Code: https://github.com/inventec-ai-center/DuoAD
💡 一句话要点
提出DuoAD以解决训练无关的少样本异常检测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 异常检测 视觉变换器 训练无关 少样本学习 自动化增强 特征重加权 全局上下文
📋 核心要点
- 现有的异常检测方法大多依赖局部特征,未能有效利用全局上下文信息,导致检测性能受限。
- 本文提出了一种新的异常检测框架,利用ViT [CLS]标记的双重特性,自动化处理异常检测任务。
- 在一-shot设置下,方法在MVTec-AD、VisA和Real-IAD数据集上分别取得了97.7%、93.2%和84.5%的Image-AUC分数,表现出色。
📝 摘要(中文)
视觉基础模型使得强大的无训练异常检测成为可能。然而,大多数现有方法主要依赖独立的局部补丁特征,未能充分利用视觉变换器(ViTs)编码的全局上下文信息。本文识别了ViT [CLS]标记的双重特性:其嵌入提供异常不变的全局语义表示,而其注意力图则隐含地突出空间异常区域。基于此观察,我们提出了一种完全自动化的异常检测框架,利用全局上下文消除手动调优。该框架引入了(1)基于[CLS]级别语义一致性的自动增强选择策略,以及(2)一种注意力引导的特征重加权机制,动态调整补丁贡献。通过整合这些组件,我们的方法在无需训练或参数调优的情况下,实现了稳定的异常评分和精确的定位。
🔬 方法详解
问题定义:本文旨在解决现有异常检测方法对全局上下文信息利用不足的问题,导致检测效果不佳。
核心思路:通过识别ViT [CLS]标记的双重特性,提出一种自动化的异常检测框架,消除手动调优的需求。
技术框架:该框架包括两个主要模块:自动增强选择策略和注意力引导的特征重加权机制,前者确保语义一致性,后者动态调整特征贡献。
关键创新:最重要的创新在于利用[CLS]标记的全局语义表示和注意力图,显著提升了异常检测的准确性和稳定性。
关键设计:框架中采用固定配置,避免了对不同类别和数据集的参数调优,确保了方法的可扩展性和鲁棒性。具体的损失函数和网络结构细节在论文中进行了详细描述。
🖼️ 关键图片
📊 实验亮点
在实验中,DuoAD在一-shot设置下分别在MVTec-AD、VisA和Real-IAD数据集上取得了97.7%、93.2%和84.5%的Image-AUC分数,显著优于现有基线,展示了其强大的异常检测能力和稳定性。
🎯 应用场景
该研究的潜在应用领域包括工业缺陷检测、医疗影像分析和安全监控等。通过提供一种无需训练的异常检测方法,DuoAD能够在多种实际场景中快速部署,提升检测效率和准确性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Vision foundation models have enabled strong training-free anomaly detection (AD). However, most existing approaches rely primarily on independent local patch features, leaving the global contextual information encoded by Vision Transformers (ViTs) underexploited. In this work, we identify the dual characteristics of the ViT [CLS] token: its embedding provides anomaly-invariant global semantic representation, while its attention maps implicitly highlight spatially abnormal regions. Building on this observation, we propose a fully automated AD framework leveraging global context to remove manual tunings. Our framework introduces (1) an automatic augmentation selection strategy driven by [CLS]-level semantic consistency, and (2) an attention-guided feature reweighting mechanism that dynamically adjusts patch contributions according to [CLS] attention saliency. By integrating these components over multi-level features, our method achieves stable anomaly scoring and precise localization without training or parameter tuning. Under the one-shot setting, it achieves Image-AUC scores of 97.7%, 93.2%, and 84.5% on MVTec-AD, VisA, and Real-IAD. Using a single fixed configuration across categories, backbones, and datasets, the method establishes a new state-of-the-art for plug-and-play, training-free anomaly detection while maintaining strong robustness and practical scalability.