Single-Teacher View Augmentation: Enhancing Knowledge Distillation with Student-Guided Perturbations

📄 arXiv: 2607.11557v1 📥 PDF

作者: Xuyi Yu, Yaohua Liu, Ziming Song, Yinghai Zhao, Huipeng Zhang, Kuizhi Mei

分类: cs.CV

发布日期: 2026-07-13


💡 一句话要点

提出SAKD以解决单教师蒸馏中的视角多样性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 知识蒸馏 单教师 扰动生成 深度学习 计算机视觉 模型压缩 多样性增强

📋 核心要点

  1. 现有知识蒸馏方法依赖单一教师,导致监督信号缺乏多样性,限制了模型性能。
  2. 本文提出SAKD框架,利用学生特征作为动态条件生成扰动,从而实现单阶段训练和多样化视角生成。
  3. 实验结果显示,SAKD在多个数据集上超越随机扰动方法,准确率与两阶段方法相当,且参数使用显著减少。

📝 摘要(中文)

知识蒸馏(KD)通常依赖于单一教师的固定视角,这限制了监督信号的多样性。虽然多教师蒸馏通过聚合多个模型的知识来解决这一问题,但会带来高昂的计算和存储成本。为平衡效率和多样性,近期研究集中于从单一教师生成虚拟视角。然而,现有方法面临效率与多样性之间的权衡。本文提出了Shift-Augmented Knowledge Distillation(SAKD),通过利用学生不断演变的特征作为扰动生成的动态条件,克服了这一权衡。实验结果表明,SAKD在CIFAR-100和ImageNet上表现优异,准确率与两阶段方法相当,同时显著减少了参数使用并消除了预训练需求。

🔬 方法详解

问题定义:本文旨在解决单教师知识蒸馏中由于固定视角导致的监督信号多样性不足的问题。现有方法在效率和多样性之间存在权衡,随机扰动方法效率高但缺乏控制,而结构化增强方法则需要多阶段训练并导致参数线性增长。

核心思路:SAKD的核心思路是利用学生模型的动态特征作为扰动生成的条件,而非依赖教师模型的静态特征。这种设计使得在单阶段训练中能够生成适应性强且多样化的视角。

技术框架:SAKD框架包括扰动生成模块和知识蒸馏模块。扰动生成模块基于学生特征进行动态扰动,而知识蒸馏模块则利用生成的视角进行模型训练。整体流程为:输入图像经过扰动生成后,得到多个视角,随后进行知识蒸馏。

关键创新:SAKD的主要创新在于通过学生特征的动态变化来生成扰动,这与现有方法的静态特征生成方式本质上不同,显著提高了视角的多样性和适应性。

关键设计:在设计上,SAKD采用无参数的循环移位方法生成扰动,避免了多阶段训练的复杂性。同时,损失函数设计上结合了学生与教师之间的知识传递,确保了训练的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在CIFAR-100和ImageNet数据集上的实验结果表明,SAKD在准确率上超越了随机扰动方法,并与两阶段方法的性能相当。具体而言,SAKD在参数使用上显著减少,且消除了预训练的需求,展现出更高的训练效率。

🎯 应用场景

该研究的潜在应用领域包括计算机视觉中的图像分类、目标检测等任务。通过提高知识蒸馏的效率和多样性,SAKD可以帮助构建更强大的模型,适用于资源受限的环境。此外,未来可能在其他领域如自然语言处理和语音识别中推广类似的方法。

📄 摘要(原文)

Knowledge distillation (KD) typically relies on the fixed perspective of a single teacher, limiting the diversity of supervisory signals. While multi-teacher distillation addresses this by aggregating knowledge from multiple models, it incurs prohibitive computational and storage costs. To balance efficiency and diversity, recent research has focused on generating virtual views from a single teacher. However, existing methods face a trade-off: random perturbation approaches offer efficiency but lack controlled diversity, while structured augmentation methods require multi-stage training and incur linear parameter growth. We observe that this trade-off stems from a common design choice: using the teacher's strong but static features to generate views. Instead, we propose Shift-Augmented Knowledge Distillation (SAKD), a simple yet effective framework that leverages the student's evolving features as a dynamic condition for perturbation generation. This shift in perspective enables single-stage training while producing adaptive, diverse views through a parameter-free cyclic shift. Extensive experiments on CIFAR-100 and ImageNet demonstrate that SAKD consistently outperforms random perturbation methods and achieves accuracy on par with two-stage approaches, while using significantly fewer parameters and eliminating pre-training requirements.