VideoCrafter1: Open Diffusion Models for High-Quality Video Generation

📄 arXiv: 2310.19512v1 📥 PDF

作者: Haoxin Chen, Menghan Xia, Yingqing He, Yong Zhang, Xiaodong Cun, Shaoshu Yang, Jinbo Xing, Yaofang Liu, Qifeng Chen, Xintao Wang, Chao Weng, Ying Shan

分类: cs.CV

发布日期: 2023-10-30

备注: Tech Report; Github: https://github.com/AILab-CVC/VideoCrafter Homepage: https://ailab-cvc.github.io/videocrafter/


💡 一句话要点

提出开源扩散模型以解决高质量视频生成问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频生成 扩散模型 文本到视频 图像到视频 开源模型

📋 核心要点

  1. 现有的视频生成方法在开源模型数量上存在不足,限制了研究人员的探索与应用。
  2. 本文提出的T2V和I2V模型分别基于文本和图像输入生成高质量视频,具有较强的内容保持能力。
  3. 实验结果显示,T2V模型在视频质量上优于其他开源模型,I2V模型成功实现了图像到视频的转换。

📝 摘要(中文)

视频生成在学术界和工业界越来越受到关注。尽管商业工具能够生成可信的视频,但可供研究人员和工程师使用的开源模型数量有限。本文提出了两种高质量视频生成的扩散模型,即文本到视频(T2V)和图像到视频(I2V)模型。T2V模型基于给定的文本输入合成视频,而I2V模型则结合了额外的图像输入。我们的T2V模型能够生成分辨率为$1024 imes 576$的逼真且具有电影质量的视频,在质量上超越了其他开源T2V模型。I2V模型旨在生成严格遵循提供的参考图像内容的视频,保持其内容、结构和风格。这一模型是首个能够在内容保持约束下将给定图像转化为视频片段的开源I2V基础模型。我们相信这些开源视频生成模型将为社区的技术进步做出重要贡献。

🔬 方法详解

问题定义:本文旨在解决现有视频生成模型在开源可用性和生成质量上的不足,尤其是缺乏高质量的文本到视频和图像到视频的模型。

核心思路:提出的T2V模型通过文本输入生成视频,而I2V模型则通过图像输入生成视频,确保生成视频在内容和风格上与输入保持一致。

技术框架:整体架构包括文本编码、图像编码和视频生成模块。T2V模型通过文本描述生成视频,而I2V模型则在此基础上增加了图像输入,确保生成视频的内容一致性。

关键创新:T2V模型在生成质量上超越了现有的开源模型,而I2V模型是首个能够在内容保持约束下将图像转化为视频的开源基础模型。

关键设计:模型采用了特定的损失函数以确保生成视频的质量,并在网络结构上进行了优化,以提高生成效率和效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,T2V模型生成的视频在质量上显著优于其他开源模型,分辨率达到$1024 imes 576$,且I2V模型成功实现了图像到视频的转换,保持了输入图像的内容和风格,展示了较强的实用性和创新性。

🎯 应用场景

该研究的潜在应用领域包括电影制作、游戏开发、广告创作等,能够为创作者提供高效的视频生成工具,降低制作成本,提高创作效率。未来,随着模型的不断优化,其在实时视频生成和个性化内容创作方面的应用前景广阔。

📄 摘要(原文)

Video generation has increasingly gained interest in both academia and industry. Although commercial tools can generate plausible videos, there is a limited number of open-source models available for researchers and engineers. In this work, we introduce two diffusion models for high-quality video generation, namely text-to-video (T2V) and image-to-video (I2V) models. T2V models synthesize a video based on a given text input, while I2V models incorporate an additional image input. Our proposed T2V model can generate realistic and cinematic-quality videos with a resolution of $1024 \times 576$, outperforming other open-source T2V models in terms of quality. The I2V model is designed to produce videos that strictly adhere to the content of the provided reference image, preserving its content, structure, and style. This model is the first open-source I2V foundation model capable of transforming a given image into a video clip while maintaining content preservation constraints. We believe that these open-source video generation models will contribute significantly to the technological advancements within the community.