FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection

📄 arXiv: 2607.22087v1 📥 PDF

作者: Md Redwanul Haque, Manzur Murshed, Manoranjan Paul, Tsz-Kwan Lee

分类: cs.CV

发布日期: 2026-07-24

备注: Accepted to ECCV 2026


💡 一句话要点

提出FAIR以解决AI生成假图像检测中的泛化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 假图像检测 生成对抗网络 正则化技术 机器学习 计算机视觉

📋 核心要点

  1. 现有的AI生成图像检测方法在泛化能力上存在严重不足,容易对低级纹理模式过拟合。
  2. 本文提出FAIR,通过引入场景组成结构(SCS)作为正交的宏观结构先验,增强模型的泛化能力。
  3. 实验结果显示,FAIR显著提升了检测器的准确率,跨生成器泛化能力提高了8.04%,在零样本迁移中表现出色。

📝 摘要(中文)

泛化能力在AI生成图像检测中仍然是一个关键瓶颈。由于许多现代生成器是专有或对抗性修改的,现有检测器往往过拟合于可获取训练数据的低级纹理模式,导致在未见领域的严重失败。传统的正则化技术(如$L_1$/$L_2$范数、Dropout)施加无差别的参数约束,未能提供跨生成器鲁棒性所需的领域不变结构。为此,本文提出了特征增强隐式正则化(FAIR),在训练过程中引入正交的宏观结构先验,即场景组成结构(SCS),以几何约束模型的优化轨迹。通过用领域不变的SCS特征增强主要特征空间,FAIR显式惩罚纹理偏向的捷径学习。该结构先验在推理时完全丢弃,从而实现平滑的、泛化的决策边界,且没有架构或计算开销。大量评估表明,将FAIR集成到最先进的检测器中显著提高了跨生成器的泛化能力,准确率提升高达8.04%,并在零样本迁移场景中建立了新的鲁棒性基准。

🔬 方法详解

问题定义:本文旨在解决AI生成假图像检测中的泛化能力不足问题。现有方法往往对训练数据的低级纹理模式过拟合,导致在未见领域的检测失败。

核心思路:FAIR的核心思路是引入场景组成结构(SCS)作为正交的宏观结构先验,以几何方式约束模型的优化过程,从而增强模型的泛化能力,避免纹理偏向的捷径学习。

技术框架:FAIR的整体架构包括两个主要阶段:训练阶段和推理阶段。在训练阶段,通过将SCS特征与主要特征空间结合,模型在优化过程中受到几何约束;在推理阶段,完全丢弃SCS特征,确保决策边界的平滑性和泛化性。

关键创新:FAIR的最大创新在于引入了场景组成结构(SCS)作为结构先验,这一设计与传统的正则化方法(如$L_1$/$L_2$范数)有本质区别,后者未能提供领域不变的结构。

关键设计:在FAIR中,损失函数设计上结合了SCS特征的惩罚项,确保模型在训练过程中不偏向于低级纹理特征。同时,网络结构保持灵活性,确保在推理时不会增加额外的计算开销。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,将FAIR集成到最先进的检测器中,准确率提升高达8.04%。在五个大型基准测试中,FAIR显著提高了跨生成器的泛化能力,建立了新的鲁棒性基准,尤其在零样本迁移场景中表现优异。

🎯 应用场景

该研究的潜在应用领域包括社交媒体内容审核、虚假信息检测以及数字取证等。FAIR的创新方法能够有效提升AI生成图像的检测能力,具有广泛的实际价值和未来影响,尤其是在对抗性生成内容日益增多的背景下。

📄 摘要(原文)

Generalization remains a critical bottleneck in AI-generated image detection. Because many modern generators are proprietary or adversarially modified, existing detectors overfit to the low-level textural patterns of accessible training data, resulting in severe failures on unseen domains. Conventional regularization techniques (e.g., $L_1$/$L_2$ norms, Dropout) apply indiscriminate parametric constraints and fail to provide the domain-invariant structure necessary for cross-generator robustness. To address this, we propose Feature-Augmented Implicit Regularization (FAIR). FAIR introduces an orthogonal, macro-structural prior, specifically, Scene Composition Structure (SCS), during training to geometrically constrain the model's optimization trajectory. By augmenting the primary feature space with domain-invariant SCS features, FAIR explicitly penalizes texture-biased shortcut learning. Crucially, this structural prior is entirely discarded at inference, yielding a smoothed, generalized decision boundary with zero architectural or computational overhead. Extensive evaluations across five massive benchmarks demonstrate that integrating FAIR into state-of-the-art detectors significantly improves cross-generator generalization, boosting accuracy by up to 8.04% and establishing new state-of-the-art robustness in zero-shot transfer scenarios.