FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models
作者: Kaiyang Ye, Yuan Ge, Junxiang Zhang, Bei Li, Ziming Zhu, Haishu Zhao, Xiaoqian Liu, Chenglong Wang, Jingbo Zhu, Zhengtao Yu, Tong Xiao
分类: cs.LG, cs.CV
发布日期: 2026-07-27
💡 一句话要点
提出FlowCTS以解决流模型的稀疏奖励和偏见问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 流模型 在线蒸馏 稀疏奖励 速度匹配 监督学习 强化学习 性能提升
📋 核心要点
- 现有方法在流模型的在线蒸馏中面临稀疏奖励和曝光偏见的挑战,导致性能提升有限。
- 本文提出FlowCTS,通过匹配学生和参考轨迹,利用速度场的积分关系来优化流模型的训练过程。
- 实验结果表明,FlowCTS-OPD在多个指标上显著优于传统方法,且收敛速度更快,提升效果明显。
📝 摘要(中文)
尽管在大型语言模型后训练中,在线蒸馏(OPD)有效解决了稀疏奖励和曝光偏见,但其在流模型中的扩展仍未得到充分探索。为此,本文提出了流连续轨迹监督(FlowCTS),通过匹配来自同一状态的学生和参考轨迹,利用轨迹与速度场之间的积分关系,推导出时间加权的速度匹配上界,并将其离散化为以监督步骤数为参数的实际目标。在多参考设置下,单状态FlowCTS-OPD在收敛速度上优于传统的基于KL的OPD。FlowCTS-OPD在GenEval、OCR和PickScore等指标上均有显著提升,同时在所有目标指标上超越了混合奖励的强化学习基线。进一步分析显示,传统KL基于OPD存在明显的时间监督不匹配问题。
🔬 方法详解
问题定义:本文旨在解决流模型在在线蒸馏过程中面临的稀疏奖励和曝光偏见问题。现有的基于KL的在线蒸馏方法在处理这些问题时效果不佳,尤其是在时间监督方面存在明显的不匹配。
核心思路:FlowCTS的核心思想是通过匹配来自同一状态的学生和参考轨迹,利用轨迹与速度场之间的关系来进行有效的监督。这种设计旨在提高模型的学习效率和收敛速度。
技术框架:FlowCTS的整体架构包括多个模块,首先是轨迹匹配模块,其次是速度场计算模块,最后是基于时间加权的损失计算模块。整个流程通过多参考设置来增强监督效果。
关键创新:FlowCTS的主要创新在于提出了时间加权的速度匹配上界,并将其离散化为实际的优化目标。这一方法与传统的基于KL的OPD方法在本质上有所不同,能够更有效地利用轨迹信息。
关键设计:在关键设计上,FlowCTS引入了监督步骤数作为参数,优化了损失函数的设计,使得模型能够在不同的监督强度下进行训练。此外,网络结构上也进行了调整,以适应新的监督机制。
🖼️ 关键图片
📊 实验亮点
实验结果显示,FlowCTS-OPD在GenEval、OCR和PickScore等指标上分别提升至0.93、0.92和23.06,超越了传统的基于KL的OPD方法,并在所有目标指标上优于混合奖励的强化学习基线,展示了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、计算机视觉和机器人等多个领域,特别是在需要处理稀疏奖励和复杂决策过程的任务中。通过提高流模型的训练效率,FlowCTS有望在实际应用中带来更高的性能和更快的收敛速度,推动相关技术的发展。
📄 摘要(原文)
While on-policy distillation (OPD) effectively addresses sparse rewards and exposure bias in large language model post-training, its extension to flow models remains underexplored. To this end, we propose Flow Continuous Trajectory Supervision (FlowCTS), which matches subsequent student and reference trajectories initialized from the same student-visited state. Using the integral relation between trajectories and velocity fields, we derive a temporally weighted velocity-matching upper bound and discretize it into practical objectives parameterized by the number of supervision steps. Under a multi-reference setup, single-state FlowCTS-OPD outperforms vanilla KL-based OPD with faster convergence. FlowCTS-OPD improves GenEval from 0.90 to 0.93, OCR from 0.90 to 0.92, and PickScore from 22.75 to 23.06, while outperforming a mixed-reward RL baseline across all target metrics. Further analysis reveals a clear temporal supervision mismatch in vanilla KL-based OPD arising from its auxiliary SDE transition kernels. Beyond on-policy setting,FlowCTS also consistently outperforms vanilla SFT , particularly on OCR, while increasing supervision steps exhibit a trade-off between richer trajectory information and greater optimization difficulty.