Can pre-trained models assist in dataset distillation?

📄 arXiv: 2310.03295v1 📥 PDF

作者: Yao Lu, Xuguang Chen, Yuchen Zhang, Jianyang Gu, Tianle Zhang, Yifan Zhang, Xiaoniu Yang, Qi Xuan, Kai Wang, Yang You

分类: cs.CV

发布日期: 2023-10-05

🔗 代码/项目: GITHUB


💡 一句话要点

利用预训练模型提升数据集蒸馏效果

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 数据集蒸馏 预训练模型 知识转移 模型多样性 领域匹配

📋 核心要点

  1. 现有的数据集蒸馏方法在知识转移和合成数据集性能上存在不足,亟需改进。
  2. 本文提出利用预训练模型的知识来指导数据集蒸馏,系统研究不同PTMs选项的影响。
  3. 实验结果表明,通过优化模型多样性和合理选择PTMs,显著提升了合成数据集的性能。

📝 摘要(中文)

数据集蒸馏(DD)是一种将大规模原始数据集中的知识封装到小型合成数据集中的重要技术,以实现高效训练。预训练模型(PTMs)作为知识库,包含了来自原始数据集的丰富信息。本文通过初步实验确认了PTMs对DD的贡献,并系统研究了PTMs的不同选项,包括初始化参数、模型架构、训练周期和领域知识。研究发现:1) 增加模型多样性可以提升合成数据集的性能;2) 次优模型在某些情况下也能辅助DD,并超越训练良好的模型;3) 领域特定的PTMs并非DD的必要条件,但合理的领域匹配至关重要。最终,通过选择最佳选项,显著提升了跨架构的泛化能力。

🔬 方法详解

问题定义:本文旨在解决如何有效利用预训练模型(PTMs)来提升数据集蒸馏(DD)效果的问题。现有方法在知识转移和合成数据集的性能上存在局限性,尤其是在模型多样性和领域匹配方面。

核心思路:论文的核心思路是通过系统研究PTMs的不同选项,探索其对数据集蒸馏的影响,进而提升合成数据集的性能。通过引入多样性和合理的领域匹配,增强知识的有效转移。

技术框架:整体架构包括数据集蒸馏的预处理、PTMs的选择与配置、模型训练和性能评估等主要模块。首先进行PTMs的选择,然后通过不同的初始化参数和架构进行训练,最后评估合成数据集的性能。

关键创新:最重要的技术创新在于发现次优模型在某些情况下能够辅助数据集蒸馏,并且模型多样性显著提升了合成数据集的性能。这一发现挑战了传统观念,认为只有经过良好训练的模型才能有效转移知识。

关键设计:关键设计包括对PTMs的初始化参数、模型架构和训练周期的选择,以及对领域知识的合理匹配。通过实验验证了这些设计对合成数据集性能的影响,确保了最佳的知识转移效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,通过引入模型多样性和合理选择PTMs,合成数据集的性能显著提升,相较于基线DD方法,跨架构泛化能力提高了XX%。次优模型在某些情况下的表现超越了经过良好训练的模型,展现了新的研究方向。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉、自然语言处理等需要高效训练的任务。通过优化数据集蒸馏过程,可以在数据稀缺的情况下,利用已有的知识库提升模型性能,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Dataset Distillation (DD) is a prominent technique that encapsulates knowledge from a large-scale original dataset into a small synthetic dataset for efficient training. Meanwhile, Pre-trained Models (PTMs) function as knowledge repositories, containing extensive information from the original dataset. This naturally raises a question: Can PTMs effectively transfer knowledge to synthetic datasets, guiding DD accurately? To this end, we conduct preliminary experiments, confirming the contribution of PTMs to DD. Afterwards, we systematically study different options in PTMs, including initialization parameters, model architecture, training epoch and domain knowledge, revealing that: 1) Increasing model diversity enhances the performance of synthetic datasets; 2) Sub-optimal models can also assist in DD and outperform well-trained ones in certain cases; 3) Domain-specific PTMs are not mandatory for DD, but a reasonable domain match is crucial. Finally, by selecting optimal options, we significantly improve the cross-architecture generalization over baseline DD methods. We hope our work will facilitate researchers to develop better DD techniques. Our code is available at https://github.com/yaolu-zjut/DDInterpreter.