OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation

📄 arXiv: 2607.18850v1 📥 PDF

作者: Shuimu Chen, Jing Jin, Nan Su, Hongbo Xu, Zebang Cheng, Wenming Yang, Fei Ma, Guijin Wang

分类: cs.CV, cs.AI

发布日期: 2026-07-21


💡 一句话要点

提出OPD-IAD以解决工业异常检测中的像素级定位问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 工业异常检测 视觉语言模型 自蒸馏 像素级定位 多模态融合

📋 核心要点

  1. 现有LVLM基础的IAD方法在生成语言判断后,难以实现精确的像素级异常图,限制了其应用效果。
  2. 本文提出OPD-IAD框架,通过在线自蒸馏和语言引导的视觉锚定,实现了语言与视觉特征的有效结合。
  3. 实验结果表明,OPD-IAD在图像级、像素级和问答指标上均表现出色,超越了大多数现有方法。

📝 摘要(中文)

大型视觉语言模型(LVLMs)在工业异常检测(IAD)中展现出强大的潜力,能够提供图像级的异常判断和可解释的缺陷推理。然而,现有基于LVLM的方法在生成语言判断后,仍难以产生精确的像素级异常图。为此,本文提出了OPD-IAD,一个证据特权的密集在线自蒸馏框架,旨在通过语言引导实现精确的像素级定位。该方法通过将特权缺陷证据蒸馏到模型的在线判断轨迹上,使最终生成的判断在密集监督下学习,而不仅仅是作为文本答案。通过语言引导的视觉锚定,结合对比热图头生成异常图,最终实现了在多个指标上超越现有方法的性能。

🔬 方法详解

问题定义:本文旨在解决现有LVLM基础的工业异常检测方法在生成语言判断后,无法有效生成精确的像素级异常图的问题。现有方法通常将语言判断视为最终答案,缺乏对视觉信息的充分利用。

核心思路:OPD-IAD框架通过将特权缺陷证据蒸馏到模型的在线判断轨迹上,使得语言判断在密集监督下学习,从而实现语言引导的异常定位,而不让语言质量直接影响像素级响应。

技术框架:OPD-IAD的整体架构包括两个主要模块:1)在线自蒸馏模块,通过对模型的判断轨迹进行蒸馏,增强判断的准确性;2)语言引导的视觉锚定模块,通过对图像和问题进行重编码,生成语义锚定,并与密集视觉特征进行对比,生成异常图。

关键创新:OPD-IAD的核心创新在于将语言判断作为密集监督的条件,结合视觉特征生成异常图,这一设计使得语言与视觉信息的结合更加紧密,突破了传统方法的局限。

关键设计:在模型设计中,采用了对比损失函数来优化视觉特征与语义锚定之间的对比,同时在网络结构上,利用热图头生成像素级异常图,确保了生成结果的精确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,OPD-IAD在多个指标上均超越了现有的LVLM基础IAD方法,尤其在图像级和像素级的表现上,提升幅度达到XX%(具体数据待补充),在问答指标上也表现优异,验证了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括工业生产线的缺陷检测、质量控制和自动化监测等。通过实现精确的像素级异常定位,OPD-IAD能够有效提升工业检测的效率和准确性,降低人工干预的需求,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Large vision-language models (LVLMs) have recently shown strong potential for industrial anomaly detection (IAD) by providing image-level anomaly judgments and interpretable defect reasoning. However, current LVLM-based IAD methods still struggle to produce precise pixel-level anomaly maps from generated language judgments. We aim to achieve precise pixel-level localization while using language as guidance rather than letting it dominate the visual response. Specifically, we propose \textbf{OPD-IAD}, an evidence-privileged dense on-policy self-distillation framework for LVLM-based IAD. OPD-IAD distills privileged defect evidence onto the model's own on-policy judgment trajectory, enabling the final generated judgment to be learned under dense supervision rather than treated only as a textual answer. The resulting judgment serves as a semantic condition for dense anomaly perception. To turn this condition into dense visual evidence, we introduce \textbf{Language-guided Visual Anchoring}, which uses a judgment reforward to re-encode the image and question under the final-judgment condition into semantic anchors and contrasts them with dense visual features through a contrastive heatmap head to generate anomaly maps. The language judgment therefore provides compact semantic guidance, while dense visual features remain the basis for pixel-level scoring, allowing language to guide anomaly localization without letting language quality directly dictate the pixel-level response. Extensive experiments show that OPD-IAD achieves the best overall performance among LVLM-based IAD methods, leading on most image-level, pixel-level, and QA metrics.