From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

📄 arXiv: 2607.14976v1 📥 PDF

作者: Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

分类: cs.CV

发布日期: 2026-07-16

备注: Accepted by ECCV 2026


💡 一句话要点

提出D2DF框架以解决视频对象移除中的草稿依赖问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 视频对象移除 蒸馏训练 快速植入 生成模型 视频编辑

📋 核心要点

  1. 现有视频对象移除方法存在明显伪影和不自然结果的问题,且多步生成方法效率低下。
  2. 提出D2DF框架,通过蒸馏技术将草稿转化为高保真视频,进而实现一步视频生成。
  3. 实验结果显示,D2DF框架在多个指标上超越了传统方法,单视频去噪时间仅需约1秒。

📝 摘要(中文)

视频对象移除是视频编辑中的一项基本而具有挑战性的任务。尽管已有进展,现有方法通常存在明显的不足。传统方法基于光流或注意力机制,常引入明显伪影,结果不自然;而扩散方法虽然提高了视觉真实感,但需要多次去噪,限制了其实用性。为了解决这些问题,我们提出了From-Draft-to-Draft-Free(D2DF)框架,该框架将粗糙草稿转化为精细视频的能力蒸馏为一步视频生成模型。通过优先特征一致性蒸馏(PPCD),我们将这一能力蒸馏到学生模型中,实现基于草稿的一步移除。为消除草稿依赖,我们引入了自指导快速植入(SGFP)模块,能够在潜在空间中自主生成场景一致的伪草稿,从而实现完全无草稿的一步模型。大量实验表明,草稿条件和无草稿版本在多个指标上均达到最先进的性能,超越了传统和多步生成方法的质量和效率。

🔬 方法详解

问题定义:论文旨在解决视频对象移除中的草稿依赖问题,现有方法常引入伪影且效率低下,影响实际应用。

核心思路:D2DF框架通过蒸馏技术将粗糙草稿转化为高质量视频,采用一步生成模型,减少了传统方法的多步去噪过程。

技术框架:D2DF框架包含教师模型和学生模型,教师模型负责将低质量结果精炼为高保真视频,学生模型通过优先特征一致性蒸馏(PPCD)实现一步移除,SGFP模块用于生成伪草稿。

关键创新:引入了自指导快速植入(SGFP)模块,使得模型在无草稿条件下也能生成一致的场景,显著提升了生成效率和质量。

关键设计:模型设计中采用了Temporal Masked Transformer,损失函数结合了重建损失和一致性损失,确保生成视频的质量和一致性。整体架构优化了去噪过程,使得单视频去噪时间缩短至约1秒。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,D2DF框架在多个指标上均达到了最先进的性能,草稿条件和无草稿版本的生成质量显著优于传统方法,且去噪时间仅需约1秒,极大提升了效率。

🎯 应用场景

该研究在视频编辑、特效制作和影视后期处理中具有广泛的应用潜力。通过实现高效、无草稿的视频对象移除,能够大幅提升视频制作的效率和质量,推动相关行业的发展。未来,该技术还可能扩展到实时视频处理和增强现实等领域。

📄 摘要(原文)

Video object removal is a fundamental yet challenging task in video editing. Despite recent progress, existing methods typically fall into two categories. Traditional approaches based on optical flow or attention mechanisms often introduce noticeable artifacts and yield unnatural results. In contrast, diffusion-based methods improve visual realism but demand multiple denoising steps, limiting their practicality. To address these issues, we propose From-Draft-to-Draft-Free (D2DF), a framework that distills the ability of transforming coarse drafts into refined videos into a one-step video generation model. Within D2DF, a teacher model is trained to refine low-quality removal results ("drafts") into high-fidelity videos by multiple steps. Then, through Prior-Privileged Consistency Distillation (PPCD), we distill this capability into a student model that performs one-step removal conditioned on the draft. To eliminate draft dependency, we introduce a Self-Guided Fast Planting (SGFP) module based on our Temporal Masked Transformer that autonomously generates scene-consistent pseudo-drafts in latent space, enabling a fully draft-free one-step model. Extensive experiments show that both draft-conditioned and draft-free versions achieve state-of-the-art performance on multiple metrics, surpassing traditional and multi-step generative methods in both quality and efficiency. The denoising process for a single video takes only about 1 second.