Harvest Video Foundation Models via Efficient Post-Pretraining
作者: Yizhuo Li, Kunchang Li, Yinan He, Yi Wang, Yali Wang, Limin Wang, Yu Qiao, Ping Luo
分类: cs.CV
发布日期: 2023-10-30 (更新: 2026-03-15)
🔗 代码/项目: GITHUB
💡 一句话要点
提出高效后预训练框架以获取视频基础模型
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视频-语言模型 后预训练 跨模态学习 高效训练 视频理解 多模态融合
📋 核心要点
- 现有的视频-语言基础模型构建成本高,且缺乏高质量的数据集,导致训练效率低下。
- 本文提出通过随机丢弃视频块和掩蔽文本的后预训练框架,以提升训练效率和跨模态学习。
- 实验结果显示,该方法在多个视频-语言任务上表现优异,训练时间短且性能接近重预训练模型。
📝 摘要(中文)
构建视频-语言基础模型的成本高且困难,主要由于视频数据的冗余性和高质量视频-语言数据集的缺乏。本文提出了一种高效的框架,通过从图像模型中获取视频基础模型。该方法通过随机丢弃输入视频块和在后预训练过程中掩蔽输入文本,显著提升训练效率,并强化跨模态融合的学习。我们在多种视频-语言下游任务上进行了广泛实验,验证了该方法的有效性,尽管方法简单,但其性能与一些重预训练的视频基础模型相当。该方法在8个GPU上训练时间不足一天,仅需WebVid-10M作为预训练数据。希望该方法能为流行的视频基础模型提供简单而强大的替代方案,并在构建时提供有用的见解,使大型预训练模型更加可及和可持续。
🔬 方法详解
问题定义:本文旨在解决构建视频-语言基础模型时的高成本和低效率问题,现有方法在数据冗余和缺乏高质量数据集方面存在明显不足。
核心思路:论文提出了一种简单有效的后预训练框架,通过随机丢弃视频输入块和掩蔽文本输入,来提升训练效率并强化跨模态融合的学习。
技术框架:整体架构包括两个主要阶段:首先是从图像模型进行初始化,然后在后预训练阶段进行视频模型的训练,重点在于视频块的随机丢弃和文本的掩蔽。
关键创新:最重要的创新在于通过简单的随机丢弃和掩蔽策略,显著提升了训练效率和模型的跨模态学习能力,这与传统的重预训练方法形成鲜明对比。
关键设计:在参数设置上,采用了适应性丢弃率和掩蔽比例,以确保模型在不同任务上的泛化能力,损失函数设计上结合了跨模态对比损失,增强了模型的学习效果。
🖼️ 关键图片
📊 实验亮点
实验结果表明,本文方法在多个视频-语言下游任务上达到了最先进的性能,尤其是在零样本任务和视频问答上,表现优于一些重预训练模型,训练时间仅需不到一天,极大提升了模型的可用性和效率。
🎯 应用场景
该研究的潜在应用领域包括视频理解、视频问答和视频-文本检索等多模态任务。其高效的训练方法能够降低构建视频基础模型的门槛,促进相关技术在教育、娱乐和安全等领域的应用,未来可能推动更多创新的多模态应用。
📄 摘要(原文)
Building video-language foundation models is costly and difficult due to the redundant nature of video data and the lack of high-quality video-language datasets. In this paper, we propose an efficient framework to harvest video foundation models from image ones. Our method is intuitively simple by randomly dropping input video patches and masking out input text during the post-pretraining procedure. The patch dropping boosts the training efficiency significantly and text masking enforces the learning of cross-modal fusion. We conduct extensive experiments to validate the effectiveness of our method on a wide range of video-language downstream tasks including various zero-shot tasks, video question answering, and video-text retrieval. Despite its simplicity, our method achieves state-of-the-art performances, which are comparable to some heavily pretrained video foundation models. Our method is extremely efficient and can be trained in less than one day on 8 GPUs, requiring only WebVid-10M as pretraining data. We hope our method can serve as a simple yet strong counterpart for prevalent video foundation models, provide useful insights when building them, and make large pretrained models more accessible and sustainable. This is part of the InternVideo project https://github.com/OpenGVLab/InternVideo.