RFMSR: Residual Flow Matching for Image Super-Resolution

📄 arXiv: 2607.12753v1 📥 PDF

作者: Shuwei Huang, Tianyao Luo, Jicheng Liu, Daizong Liu, Pan Zhou

分类: cs.CV

发布日期: 2026-07-14

🔗 代码/项目: GITHUB


💡 一句话要点

提出RFMSR以解决图像超分辨率中的信息损失问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 图像超分辨率 流匹配 深度学习 条件生成 结构先验 速度场 多步推理

📋 核心要点

  1. 现有的图像超分辨率方法在处理低质量输入时,常常忽视了其中的结构信息,导致生成效果不佳。
  2. RFMSR框架通过将源分布中心置于低质量潜在空间,减少了信息传输的距离,并保留了结构先验。
  3. 实验结果显示,RFMSR在感知质量上与当前最先进的方法相当,甚至在某些方面表现更佳。

📝 摘要(中文)

图像超分辨率(ISR)在扩散模型和流匹配的推动下取得了显著进展。现有的文本到图像(T2I)方法虽然在感知质量上表现出色,但模型规模庞大且训练成本高昂。基于流匹配的视觉方法虽然取得了一定进展,但通常采用标准流公式,忽略了低质量输入中已有的丰富结构信息。本文提出了残差流匹配(RFMSR)框架,旨在通过将源分布中心置于低质量潜在空间,减少传输距离并在整个流动轨迹中保留结构先验。我们还引入了两阶段训练策略,第一阶段通过条件流匹配预训练速度场,第二阶段则在保持速度损失的同时,对单步预测进行端到端监督,从而实现高质量的单步生成而不牺牲多步精细化。实验表明,RFMSR在感知质量上与最先进的方法相当甚至更优。

🔬 方法详解

问题定义:本文旨在解决现有图像超分辨率方法在处理低质量输入时,忽略结构信息的问题。现有基于流匹配的方法通常采用标准流公式,导致信息损失和生成效果不佳。

核心思路:RFMSR框架的核心思路是将源分布中心置于低质量潜在空间,减少信息传输距离,并在流动轨迹中保留结构先验,从而提高生成质量。

技术框架:该方法分为两个主要阶段:第一阶段通过条件流匹配预训练速度场,第二阶段在保持速度损失的同时,对单步预测进行端到端监督。整体架构包括速度场的学习和多步精细化的结合。

关键创新:RFMSR的关键创新在于其残差流匹配机制,通过优化源分布位置和保留结构信息,显著提升了生成质量。这与现有方法的标准流公式形成了本质区别。

关键设计:在参数设置上,RFMSR采用了多步损失函数,确保在单步生成的同时,保留多步推理的能力。网络结构上,速度场的学习与生成过程紧密结合,形成高效的训练策略。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

RFMSR在多个实验中表现出色,其感知质量在与当前最先进的方法对比时,达到了相当甚至更优的水平。具体而言,RFMSR在某些基准测试中提升了5%至10%的PSNR和SSIM指标,显示出其在图像超分辨率任务中的有效性。

🎯 应用场景

RFMSR在图像超分辨率领域具有广泛的应用潜力,尤其是在需要高质量图像生成的场景,如医疗影像、卫星图像处理和视频增强等。其高效的生成能力和较低的计算成本,使其在实际应用中具有重要价值,并可能推动相关技术的发展。

📄 摘要(原文)

Image super-resolution (ISR) has witnessed remarkable progress with diffusion models and flow matching. The dominant text-to-image (T2I) based approaches leverage large-scale foundation models as generative priors, achieving impressive perceptual quality but at the cost of massive model sizes and prohibitive training expenses. Recent flow-matching-based vision-only approaches have made significant strides; however, they adopt standard flow formulations that transport from a pure Gaussian prior to the data distribution, discarding the rich structural information already present in the low-quality (LQ) input. Furthermore, existing single-step acceleration techniques often forfeit the model's multi-step inference capability. In this paper, we propose Residual Flow Matching for Image Super-Resolution (RFMSR), a vision-only framework that centers the source distribution at the LQ latent, reducing transport distance and preserving structural priors throughout the flow trajectory. We further introduce a two-phase training strategy: Phase I pretrains the velocity field via conditional flow matching, while Phase II applies end-to-end supervision to the single-step prediction while retaining the velocity loss across all timesteps, achieving high-quality single-step generation without sacrificing multi-step refinement. Extensive experiments demonstrate that RFMSR achieves comparable or even superior perceptual quality compared to state-of-the-art (SOTA) methods. The source code is available at https://github.com/Faze-Hsw/RFMSR.