DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video Editing
作者: Jia-Wei Liu, Yan-Pei Cao, Jay Zhangjie Wu, Weijia Mao, Yuchao Gu, Rui Zhao, Jussi Keppo, Ying Shan, Mike Zheng Shou
分类: cs.CV
发布日期: 2023-10-16 (更新: 2023-12-07)
备注: Project Page: https://showlab.github.io/DynVideo-E/
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出DynVideo-E以解决长视频人类中心编辑问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 长视频编辑 动态神经辐射场 视频表示 多视角采样 人类中心场景 扩散模型 一致性编辑 超分辨率技术
📋 核心要点
- 现有的扩散视频编辑方法在处理长视频时面临长时间一致性与逐帧编辑的矛盾,限制了其应用。
- 本文提出动态神经辐射场(NeRF)作为视频表示,允许在3D空间中进行编辑,并通过变形场实现全视频传播。
- 实验结果显示,DynVideo-E在两个挑战性数据集上相较于现有方法提升了50%至95%的用户偏好评分。
📝 摘要(中文)
尽管最近在基于扩散的视频编辑方面取得了进展,但现有方法因长时间一致性与逐帧编辑之间的矛盾而受到限制。以往尝试通过引入视频-2D表示来解决这一挑战,但在大规模运动和视角变化的视频中,尤其是人类中心场景中,遇到了显著困难。为此,本文提出了动态神经辐射场(NeRF)作为创新的视频表示,允许在3D空间中进行编辑,并通过变形场传播到整个视频。为了提供一致且可控的编辑,我们提出了一种基于图像的视频-NeRF编辑管道,包含多视角多姿态的分数蒸馏采样、重建损失、文本引导的局部部分超分辨率和风格迁移等创新设计。大量实验表明,DynVideo-E在两个具有挑战性的数据集上显著超越了现有最先进的方法,提升幅度达到50%至95%。
🔬 方法详解
问题定义:本文旨在解决现有基于扩散的视频编辑方法在长视频处理中的局限性,尤其是在大规模运动和视角变化的情况下,难以保持一致性和可控性。
核心思路:通过引入动态神经辐射场(NeRF)作为视频表示,允许在3D空间中进行编辑,并利用变形场将编辑效果传播到整个视频,从而克服现有方法的不足。
技术框架:整体架构包括图像基础的视频-NeRF编辑管道,主要模块包括多视角多姿态的分数蒸馏采样、重建损失、文本引导的局部部分超分辨率和风格迁移等。
关键创新:最重要的技术创新在于动态NeRF的引入,使得视频编辑可以在3D空间中进行,并通过变形场实现全局一致性,这与传统的逐帧编辑方法有本质区别。
关键设计:在设计中,采用了多视角多姿态的分数蒸馏采样策略,结合2D个性化扩散先验和3D扩散先验,同时引入重建损失和文本引导的超分辨率技术,以增强编辑的质量和一致性。
🖼️ 关键图片
📊 实验亮点
在实验中,DynVideo-E在两个具有挑战性的数据集上相较于现有最先进的方法,用户偏好评分提升幅度达到50%至95%。这一显著的性能提升表明了该方法在处理复杂人类中心视频编辑任务中的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括电影制作、游戏开发和虚拟现实等人类中心的视频编辑场景。通过提供高效且一致的编辑工具,DynVideo-E能够显著提升创作者的工作效率和作品质量,未来可能在多媒体内容创作中发挥重要作用。
📄 摘要(原文)
Despite recent progress in diffusion-based video editing, existing methods are limited to short-length videos due to the contradiction between long-range consistency and frame-wise editing. Prior attempts to address this challenge by introducing video-2D representations encounter significant difficulties with large-scale motion- and view-change videos, especially in human-centric scenarios. To overcome this, we propose to introduce the dynamic Neural Radiance Fields (NeRF) as the innovative video representation, where the editing can be performed in the 3D spaces and propagated to the entire video via the deformation field. To provide consistent and controllable editing, we propose the image-based video-NeRF editing pipeline with a set of innovative designs, including multi-view multi-pose Score Distillation Sampling (SDS) from both the 2D personalized diffusion prior and 3D diffusion prior, reconstruction losses, text-guided local parts super-resolution, and style transfer. Extensive experiments demonstrate that our method, dubbed as DynVideo-E, significantly outperforms SOTA approaches on two challenging datasets by a large margin of 50% ~ 95% for human preference. Code will be released at https://showlab.github.io/DynVideo-E/.