OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators
作者: Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen
分类: cs.CV
发布日期: 2026-07-09
备注: Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V
💡 一句话要点
提出OPSD-V以解决长视频生成中的动态衰退问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 长视频生成 自回归模型 自蒸馏 视频扩散 运动动态 去噪技术 深度学习 生成模型
📋 核心要点
- 现有的少步自回归视频生成器在长时间生成过程中存在误差累积和运动动态减弱的问题。
- OPSD-V通过引入真实长视频数据作为时间上下文,提供密集的轨迹级监督,从而减少长时间范围的衰退。
- 实验表明,OPSD-V在视觉质量和运动动态上均有显著提升,用户研究显示66.0%的参与者偏好OPSD-V生成的视频。
📝 摘要(中文)
我们提出了OPSD-V,一种用于后训练少步自回归视频扩散模型的在线自蒸馏范式。现有的少步自回归视频生成器能够以低延迟生成长视频,但在长时间自回归生成过程中仍然面临误差累积和运动动态减弱的问题。OPSD-V在保持原始少步推理路径的同时,减少了长时间范围的衰退。其关键思想是在训练过程中引入真实的长视频数据作为时间上下文,并利用其提供密集的轨迹级监督。具体而言,学生模型遵循精确的推理时间生成过程,每个片段的生成都依赖于其之前生成的KV缓存。同时,教师模型在相同的去噪状态下进行评估,但使用更干净的自回归一致时间缓存,其中较旧的历史可以被真实视频上下文替换。这为在线自回归缓存动态下提供了密集的去噪级纠正目标,而无需改变采样器、去噪步骤数量或推理时间缓存机制。我们将OPSD-V应用于代表性的少步自回归视频模型,包括Self-Forcing和LongLive。实验结果显示在视觉质量、运动动态和VBenchLong评分上均有一致的提升。
🔬 方法详解
问题定义:本论文旨在解决现有少步自回归视频生成模型在长时间生成过程中出现的误差累积和运动动态减弱的问题。这些问题导致生成视频的质量下降,影响用户体验。
核心思路:OPSD-V的核心思路是引入真实的长视频数据作为训练过程中的时间上下文,以提供密集的轨迹级监督。这种设计旨在在保持原始推理路径的同时,减少长时间范围的衰退。
技术框架:OPSD-V的整体架构包括学生模型和教师模型。学生模型在推理时间生成过程中遵循精确的生成路径,而教师模型则在相同的去噪状态下进行评估,使用更干净的自回归一致时间缓存。
关键创新:OPSD-V的主要创新在于其在线自蒸馏机制,通过在推理过程中使用真实视频上下文来替换较旧的历史,从而提供密集的去噪级纠正目标。这一方法与现有的自回归视频生成方法本质上不同,因为它不需要改变采样器或去噪步骤。
关键设计:在OPSD-V中,学生模型和教师模型的设计均考虑了去噪级纠正目标的密集性,确保了生成过程中的一致性。此外,模型的参数设置和损失函数设计也经过精心调整,以优化生成质量和动态表现。
🖼️ 关键图片
📊 实验亮点
实验结果显示,OPSD-V在视觉质量和运动动态方面均有显著提升,VBenchLong评分的改进幅度明显。此外,用户研究表明,在20对视频比较中,66.0%的参与者偏好OPSD-V生成的视频,排除平局后这一比例达到82.5%。
🎯 应用场景
该研究的潜在应用领域包括影视制作、游戏开发和虚拟现实等需要高质量视频生成的场景。通过提升视频生成的质量和动态表现,OPSD-V有望在内容创作和娱乐行业中发挥重要作用,推动相关技术的发展与应用。未来,该方法也可能扩展到其他类型的生成模型中,提升其生成效果。
📄 摘要(原文)
We propose OPSD-V, an on-policy self-distillation paradigm for post-training few-step autoregressive (AR) video diffusion models. Existing few-step AR video generators can produce long videos with low latency, but still suffer from error accumulation and weakened motion dynamics during long autoregressive rollout. OPSD-V reduces long-horizon degradation while preserving the original few-step inference path. The key idea is to introduce real long-video data as temporal context during training and use it to provide dense trajectory-level supervision. Specifically, the student follows the exact inference-time rollout, generating each chunk conditioned on its own previously generated KV cache. In parallel, the teacher is evaluated at the same student-visited denoising states, but uses a cleaner AR-consistent temporal cache in which older history can be replaced by real-video context. This provides dense denoising-level corrective targets under on-policy AR cache dynamics, without changing the sampler, number of denoising steps, or inference-time cache mechanism. We apply OPSD-V to representative few-step AR video models, including Self-Forcing and LongLive. Experiments show consistent improvements in visual quality, motion dynamics, and VBenchLong scores. A user study with 10 participants comparing 20 video pairs shows that OPSD-V is preferred over the base models in 66.0% of overall-preference judgments (82.5% excluding ties).