TiC-CLIP: Continual Training of CLIP Models

📄 arXiv: 2310.16226v3 📥 PDF

作者: Saurabh Garg, Mehrdad Farajtabar, Hadi Pouransari, Raviteja Vemulapalli, Sachin Mehta, Oncel Tuzel, Vaishaal Shankar, Fartash Faghri

分类: cs.CV, cs.CL, cs.LG

发布日期: 2023-10-24 (更新: 2024-03-21)

备注: ICLR 2024

🔗 代码/项目: GITHUB


💡 一句话要点

提出TiC-CLIP以解决CLIP模型持续更新问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 持续学习 视觉-语言模型 重演训练 时间鲁棒性 大规模数据集

📋 核心要点

  1. 现有的基础模型在不断更新数据时,重训练的成本极高,缺乏有效的持续学习方法。
  2. 本文提出了一种新的持续训练方法,通过重演旧数据来减少计算成本,避免从头开始重训练。
  3. 实验结果表明,使用重演方法训练的模型在时间连续数据上表现更优,计算效率提高了2.5倍。

📝 摘要(中文)

保持大型基础模型在最新数据上的更新成本高昂。为了避免频繁重训练的高成本,持续训练这些模型显得尤为重要。然而,缺乏大规模的持续学习基准和基线使得这一问题更加复杂。本文首次引入了用于训练视觉-语言模型的网络规模时间持续(TiC)基准,包括TiC-DataComp、TiC-YFCC和TiC-Redcaps。TiC-DataComp是我们最大的数据库,包含超过127亿个带时间戳的图像-文本对,跨越9年(2014-2022)。我们利用这些基准评估现有模型的时间鲁棒性,发现OpenAI的CLIP在2021-2022年的检索任务中,零-shot准确率下降约8%。我们还研究了如何高效地在时间连续数据上训练模型,展示了一种基于重演的简单方法,能够将计算量减少2.5倍。代码可在https://github.com/apple/ml-tic-clip获取。

🔬 方法详解

问题定义:本文旨在解决大型视觉-语言模型在更新数据时的高昂重训练成本问题。现有方法缺乏有效的持续学习基准,导致模型在新数据上的表现下降。

核心思路:论文提出了一种基于重演的持续训练方法,通过从最后的检查点继续训练并重放旧数据,显著降低计算资源的消耗。这样的设计旨在提高模型在时间连续数据上的适应性和鲁棒性。

技术框架:整体架构包括数据收集、动态评估和模型训练三个主要模块。首先,构建TiC基准数据集;其次,设计动态评估任务以测试模型的时间鲁棒性;最后,实施基于重演的训练策略。

关键创新:最重要的技术创新在于引入了TiC基准数据集,并提出了一种高效的重演训练方法。这与传统的从头开始重训练的方法本质上不同,能够在保持性能的同时显著降低计算成本。

关键设计:在训练过程中,采用了特定的重演策略,确保旧数据的有效利用,并在损失函数中考虑了时间因素,以增强模型对时间变化的适应能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,使用TiC基准进行训练的模型在2021-2022年的检索任务中,零-shot准确率下降约8%,而基于重演的训练方法相比传统重训练方法计算效率提高了2.5倍,展现了显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括图像检索、视频分析和多模态学习等。通过持续训练,模型能够更好地适应快速变化的数据环境,提升实际应用中的准确性和效率,具有重要的实际价值和未来影响。

📄 摘要(原文)

Keeping large foundation models up to date on latest data is inherently expensive. To avoid the prohibitive costs of constantly retraining, it is imperative to continually train these models. This problem is exacerbated by the lack of any large scale continual learning benchmarks or baselines. We introduce the first set of web-scale Time-Continual (TiC) benchmarks for training vision-language models: TiC-DataComp, TiC-YFCC, and TiC-Redcaps. TiC-DataComp, our largest dataset, contains over 12.7B timestamped image-text pairs spanning 9 years (2014-2022). We first use our benchmarks to curate various dynamic evaluations to measure temporal robustness of existing models. We show OpenAI's CLIP (trained on data up to 2020) loses $\approx 8\%$ zero-shot accuracy on our curated retrieval task from 2021-2022 compared with more recently trained models in OpenCLIP repository. We then study how to efficiently train models on time-continuous data. We demonstrate that a simple rehearsal-based approach that continues training from the last checkpoint and replays old data reduces compute by $2.5\times$ when compared to the standard practice of retraining from scratch. Code is available at https://github.com/apple/ml-tic-clip.