Spectral Prior for Reducing Exposure Bias in Diffusion Models

📄 arXiv: 2607.22091v1 📥 PDF

作者: Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji

分类: cs.CV

发布日期: 2026-07-24

备注: Accepted at ECCV2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出谱先验以减少扩散模型中的曝光偏差问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱四:生成式动作 (Generative Motion)

关键词: 扩散模型 曝光偏差 谱对齐 信噪比 生成模型 图像生成 视频合成

📋 核心要点

  1. 现有扩散模型在迭代采样时容易出现曝光偏差,导致生成结果质量下降。
  2. 论文提出谱对齐(SPA)方法,通过校准中间预测的功率谱来解决频率依赖的SNR误差问题。
  3. 实验表明,SPA在多种架构上均能实现一致的性能提升,计算开销仅为3-4%。

📝 摘要(中文)

扩散模型在迭代采样过程中通常会遭遇误差累积问题,称为曝光偏差。本文揭示了训练与推理之间的系统性频率依赖差异,这可以被解释为频率依赖的信噪比(SNR)误差。重要的是,这种不匹配的方向在不同模型和时间步长中变化,表明固定的修正规则无法通用。我们提出了一种轻量级的基于引导的方法——谱对齐(SPA),该方法通过将中间预测的功率谱校准到预先计算的先验来解决这一问题。我们的实现可在GitHub上获取。

🔬 方法详解

问题定义:本文旨在解决扩散模型在推理阶段的曝光偏差问题,现有方法在训练与推理之间存在频率依赖的误差累积,导致生成质量下降。

核心思路:提出谱对齐(SPA)方法,通过校准中间预测的功率谱与预先计算的先验相匹配,来减少频率依赖的SNR误差。该方法在推理时提供了有效的引导。

技术框架:SPA方法分为两个阶段:第一阶段是离线拟合参数谱模型,基于训练数据进行;第二阶段是在推理时通过高效的FFT(快速傅里叶变换)计算梯度进行引导。

关键创新:SPA的主要创新在于其轻量级设计和频率依赖校准机制,能够适应不同模型和时间步长的变化,克服了固定修正规则的局限性。

关键设计:在参数设置上,SPA引入了少量的计算开销(3-4%),并且与无分类器引导(CFG)方法互补,增强了模型的生成能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SPA方法在多种模型架构上均实现了显著的性能提升,尤其是在像素空间模型(DDPM、ADM)和潜在扩散模型(SD2.0、SDXL)上,性能提升幅度可达数个百分点,验证了其有效性。

🎯 应用场景

该研究的潜在应用领域包括图像生成、视频合成和其他需要高质量生成的任务。通过减少曝光偏差,SPA方法能够提升生成模型的稳定性和输出质量,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Diffusion models typically suffer from error accumulation during iterative sampling, commonly referred to as exposure bias. We reveal systematic frequency-dependent discrepancies between training and inference, which can be interpreted as frequency-dependent SNR error. Crucially, the direction of this mismatch varies across models and timesteps, indicating that fixed correction rules do not generalize. We propose Spectral Alignment (SPA), a lightweight, guidance-based method that calibrates the power spectrum of intermediate predictions to a pre-computed prior. Our approach consists of two stages: (1) offline fitting of a parametric spectrum model from training data, and (2) inference-time guidance via efficient FFT-based gradient computation. SPA introduces minimal computational overhead (3-4\%) and is complementary to Classifier-Free Guidance (CFG). We demonstrate consistent improvements across diverse architectures, from pixel-space models (DDPM, ADM) to latent diffusion models (SD2.0, SDXL) and flow-matching models (SD3.5, FLUX). Our implementation is available at https://github.com/SonyResearch/SPA.