TC-MAF: Train-Calibrated Bounded Multi-Evidence Fusion for Multimodal Industrial Anomaly Detection
作者: Ming Deng, Sijin Sun, Xiaochuan Hu, Xing Wu
分类: cs.CV
发布日期: 2026-07-13
备注: accepted by ACM MM 2026
💡 一句话要点
提出TC-MAF以解决多模态工业异常检测中的信息融合问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态异常检测 信息融合 工业应用 Dinomaly证据 训练分散置信度 像素级融合 深度学习
📋 核心要点
- 现有的多模态异常检测方法在不同产品类别中对RGB重建的可靠性存在差异,且缺乏有效的测试时策略选择。
- 提出TC-MAF,通过固定的像素级融合公式,将多模态检测器与Dinomaly证据和跨模态一致性线索结合,提升异常检测性能。
- 在MVTec-3D数据集上,TC-MAF实现了0.979的图像级AUROC和0.990的像素级AUPRO,超越了其他多模态方法的表现。
📝 摘要(中文)
多模态异常检测利用RGB和3D证据的互补性,但辅助RGB重建在不同产品类别中的可靠性不均,且在测试时通常缺乏类别选择策略。本文提出TC-MAF,一种基于基准的多证据融合设计,将多模态检测器、互补的Dinomaly证据和小型跨模态一致性线索结合在一个固定的像素级融合公式下。轻量级的训练分散置信度(TDC)项仅使用正常训练统计来调整辅助参与度。在MVTec-3D数据集上,TC-MAF达到了0.979的图像级AUROC和0.990的像素级AUPRO,在检测和定位方面均取得了最佳的平均结果。系统的消融实验表明,融合结构本身是主导因素,而TDC提供了相较于无校准或任意校准的较小但可重复的校准增益。
🔬 方法详解
问题定义:本文旨在解决多模态工业异常检测中RGB和3D证据融合的不均衡性问题。现有方法在不同产品类别中对RGB重建的可靠性差异,导致检测效果不佳。
核心思路:TC-MAF通过设计一个基于基准的多证据融合框架,结合多模态检测器和Dinomaly证据,利用固定的像素级融合公式来提升检测的准确性和可靠性。
技术框架:TC-MAF的整体架构包括多模态检测器、Dinomaly证据和跨模态一致性线索,采用轻量级的训练分散置信度(TDC)项来调整辅助参与度,确保在训练阶段的统计信息能够有效应用于测试阶段。
关键创新:TC-MAF的主要创新在于其固定的像素级融合公式和TDC的引入,使得模型在不同类别和条件下都能保持较高的检测性能。这一设计与现有方法的灵活性和复杂性形成鲜明对比。
关键设计:在模型设计中,TDC项的设置是关键,通过仅使用正常训练统计来调整辅助参与度。此外,模型在不同的实验设置下(如少样本设置和跨数据集评估)均表现出良好的鲁棒性。
🖼️ 关键图片
📊 实验亮点
TC-MAF在MVTec-3D数据集上取得了0.979的图像级AUROC和0.990的像素级AUPRO,显著优于其他多模态方法,展示了其在检测和定位任务中的卓越性能。消融实验表明,融合结构是性能提升的主要因素,而TDC则提供了可重复的校准增益。
🎯 应用场景
TC-MAF在工业异常检测领域具有广泛的应用潜力,尤其是在制造业和质量控制中。通过有效融合多模态数据,该方法能够提高产品缺陷检测的准确性,降低误报率,从而提升生产效率和产品质量。未来,该技术还可扩展至其他领域,如智能监控和安全检测等。
📄 摘要(原文)
Multimodal anomaly detection benefits from complementary RGB and 3D evidence, yet auxiliary RGB reconstruction is not equally reliable across product categories and class-wise test-time policy selection is usually unavailable. We propose TC-MAF, a base-anchored multi-evidence fusion design that combines a multimodal detector, complementary Dinomaly evidence, and a small cross-modal consistency cue under one fixed pixel-level fusion formula. A lightweight training-dispersion confidence (TDC) term scales auxiliary participation using only normal training statistics. On MVTec-3D, TC-MAF reaches 0.979 image-level AUROC and 0.990 pixel-level AUPRO, achieving the best mean results on both detection and localization among the compared multimodal methods. Systematic ablations show that the fusion structure itself is the dominant factor, while TDC provides a smaller but reproducible calibration gain over no calibration or arbitrary calibration. Additional experiments show that the same design remains effective under a pooled-statistics variant, auxiliary-branch and backbone substitutions, few-shot settings, a missing-3D setting, and cross-dataset evaluation on Eyecandies. Code is available at https://anonymous.4open.science/r/TC_MAF-C3BB.