Data Distillation Can Be Like Vodka: Distilling More Times For Better Quality

📄 arXiv: 2310.06982v1 📥 PDF

作者: Xuxi Chen, Yu Yang, Zhangyang Wang, Baharan Mirzasoleiman

分类: cs.CV, cs.LG

发布日期: 2023-10-10

备注: Preprint


💡 一句话要点

提出渐进式数据蒸馏以提升深度网络训练性能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 数据集蒸馏 深度学习 合成数据 训练动态 模型泛化

📋 核心要点

  1. 现有的数据集蒸馏技术在与原始数据训练的比较中存在显著的性能差距,无法充分利用深度网络的训练动态。
  2. 提出渐进式数据蒸馏(PDD),通过合成多个小的合成图像集,捕捉不同训练阶段的动态,从而提升泛化性能。
  3. 实验结果显示,PDD能够将现有数据集蒸馏方法的性能提升最高达4.3%,并首次实现生成更大规模的合成数据集。

📝 摘要(中文)

数据集蒸馏旨在通过创建一小组合成图像,减少在大数据集上训练深度网络所需的时间和内存,从而实现与完整数据集相似的泛化性能。然而,现有的数据集蒸馏技术在与原始数据训练的比较中表现不佳。本文首次提出,仅使用一个合成子集进行蒸馏无法获得最佳的泛化性能,因为深度网络的训练动态在训练过程中发生显著变化。因此,需要多个合成子集来捕捉不同训练阶段的动态。为此,我们提出了渐进式数据蒸馏(PDD),该方法合成多个小的合成图像集,每个集基于前一个集,并在这些子集的累积并集上训练模型,而无需额外的训练时间。我们的广泛实验表明,PDD能够有效提升现有数据集蒸馏方法的性能,最高可达4.3%。此外,我们的方法首次实现了生成更大规模的合成数据集。

🔬 方法详解

问题定义:本论文旨在解决现有数据集蒸馏方法在训练深度网络时的性能不足问题。现有方法通常仅使用一个合成子集进行蒸馏,未能充分捕捉训练动态的变化,导致泛化性能不佳。

核心思路:论文提出的渐进式数据蒸馏(PDD)方法,通过合成多个小的合成图像集,每个集基于前一个集,旨在捕捉不同训练阶段的动态变化,从而提升模型的泛化能力。

技术框架:PDD的整体架构包括多个阶段:首先合成初始的合成图像集,然后在此基础上逐步生成后续的合成集,最后在所有合成集的累积并集上进行模型训练。该方法不需要额外的训练时间,能够高效利用已有的训练资源。

关键创新:PDD的主要创新在于引入了多个合成子集的概念,突破了传统方法仅依赖单一子集的局限,能够更全面地反映训练动态的变化,从而显著提升泛化性能。

关键设计:在PDD中,合成图像集的生成过程是逐步的,每个新生成的集都基于前一个集的特征。此外,损失函数的设计考虑了多个阶段的训练动态,确保模型在不同阶段都能获得有效的学习反馈。具体的网络结构和参数设置在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,渐进式数据蒸馏(PDD)能够将现有数据集蒸馏方法的性能提升最高达4.3%。此外,PDD首次实现了生成更大规模的合成数据集,为后续研究提供了新的方向和可能性。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、自然语言处理等需要大规模数据集的深度学习任务。通过有效的合成数据集生成,PDD能够帮助研究人员和工程师在数据稀缺的情况下,快速构建高质量的训练集,从而提升模型性能,降低训练成本。未来,该方法可能在自动驾驶、医疗影像分析等领域产生深远影响。

📄 摘要(原文)

Dataset distillation aims to minimize the time and memory needed for training deep networks on large datasets, by creating a small set of synthetic images that has a similar generalization performance to that of the full dataset. However, current dataset distillation techniques fall short, showing a notable performance gap when compared to training on the original data. In this work, we are the first to argue that using just one synthetic subset for distillation will not yield optimal generalization performance. This is because the training dynamics of deep networks drastically change during the training. Hence, multiple synthetic subsets are required to capture the training dynamics at different phases of training. To address this issue, we propose Progressive Dataset Distillation (PDD). PDD synthesizes multiple small sets of synthetic images, each conditioned on the previous sets, and trains the model on the cumulative union of these subsets without requiring additional training time. Our extensive experiments show that PDD can effectively improve the performance of existing dataset distillation methods by up to 4.3%. In addition, our method for the first time enable generating considerably larger synthetic datasets.