Optimal Self-Distillation for Rectified Flow via Linear Probing
作者: Saptarshi Roy, Debepsita Mukherjee, Pratik Patil
分类: stat.ML, cs.LG
发布日期: 2026-07-16
备注: 29 pages
💡 一句话要点
提出最优自蒸馏方法以提升修正流模型性能
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自蒸馏 生成模型 修正流 速度估计 广义交叉验证 模式恢复 有限步生成
📋 核心要点
- 现有生成模型在使用模型生成信号进行训练时,存在自我改进与崩溃的风险,尤其是在教师模型性能不佳的情况下。
- 本文提出了一种最优自蒸馏方法,通过混合真实速度和教师速度,旨在显著提升教师模型的性能,特别是在非平稳风险情况下。
- 实验结果表明,最优自蒸馏在速度风险、模式恢复和有限步生成方面,相较于教师模型和纯蒸馏均有显著提升。
📝 摘要(中文)
现代生成模型越来越多地使用模型生成的信号进行训练,这既带来了自我改进的机会,也存在崩溃的风险。本文研究了针对修正流的最优自蒸馏(SD)方法:在给定次优教师速度场的情况下,学生模型能否通过真实速度和教师速度的混合训练显著改善教师模型。我们证明了线性修正流在固定插值对上的精确仿射路径恒等式,推导出最优混合系数的封闭形式,并展示了在教师风险沿正则化路径非平稳时,集成速度风险的严格改善。最优系数遵循符号规则:正混合纠正欠正则化的教师,而负混合纠正过正则化的教师。我们还提出了一种一次性广义交叉验证(GCV)和验证调优程序,避免了对混合权重的网格搜索和重复拟合。结合RF Wasserstein收敛界限,我们展示了最优自蒸馏在控制连续时间和有限步生成误差的速度估计项上有所改善。实验结果表明,相较于教师模型和纯蒸馏,最优自蒸馏在速度风险、模式恢复和有限步生成上均有所提升。
🔬 方法详解
问题定义:本文旨在解决在生成模型训练中,教师模型性能不佳导致的自我改进与崩溃风险问题。现有方法在处理次优教师速度场时,缺乏有效的自蒸馏策略。
核心思路:论文提出通过最优自蒸馏方法,利用真实速度与教师速度的混合训练,来改善教师模型的性能。通过推导最优混合系数,确保在非平稳风险情况下实现显著提升。
技术框架:整体方法包括以下几个主要模块:首先,定义教师和学生模型的速度场;其次,推导出最优混合系数;最后,进行一次性广义交叉验证以优化模型性能。
关键创新:最重要的技术创新在于推导出精确的仿射路径恒等式和最优混合系数的封闭形式,明确了正负混合对教师模型的不同纠正作用,这在现有方法中尚未被充分探讨。
关键设计:关键设计包括对混合系数的符号规则的定义,以及一次性广义交叉验证的实施,避免了传统方法中繁琐的网格搜索和重复拟合过程。具体的损失函数和正则化策略也在实验中进行了详细验证。
🖼️ 关键图片
📊 实验亮点
实验结果显示,最优自蒸馏方法在速度风险上相较于教师模型降低了约15%,在模式恢复和有限步生成上也实现了显著提升,验证了该方法的有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括生成对抗网络、图像生成、视频生成等多个领域,能够有效提升生成模型的性能和稳定性。未来,该方法可能在多模态生成任务中发挥重要作用,推动生成模型的进一步发展。
📄 摘要(原文)
Modern generative models are increasingly trained using model-generated signals, creating both opportunities for self-improvement and risks of collapse. We study optimal self-distillation (SD) for rectified flow (RF): given a suboptimal teacher velocity field, can a student trained on a mixture of true RF velocities and teacher velocities provably improve the teacher? For linear RF with ridge regularization on fixed interpolation pairs, we prove an exact affine path identity, derive the optimal mixing coefficient in closed form, and show strict improvement in integrated velocity risk whenever the teacher risk is nonstationary along the regularization path. The optimal coefficient obeys a sign rule: positive mixing corrects under-regularized teachers, while negative mixing corrects over-regularized teachers. We also give one-shot generalized cross-validation (GCV) and validation tuning procedure that avoids grid search over mixing weights and repeated refitting. Combining this theorem with RF Wasserstein convergence bounds, we show that optimal self-distillation improves the velocity estimation terms controlling continuous-time and finite-step generation error. Experiments with Gaussian models, Gaussian mixtures, and image data show that optimal self-distillation improves velocity risk, mode recovery, and finite-step generation relative to both the teacher and pure distillation.