When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization

📄 arXiv: 2607.19956v1 📥 PDF

作者: Dipto Sumit, Ankan Kumar Roy Srizon, Sadia Khair Rodela, Atia Haque Asha, Mourchona Afrin, Niloy Farhan, Farig Sadeque

分类: cs.CL, cs.AI

发布日期: 2026-07-22


💡 一句话要点

提出可靠性感知蒸馏方法以解决低资源语言摘要问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 知识蒸馏 低资源语言 摘要生成 模型压缩 可靠性评估 机器学习 自然语言处理

📋 核心要点

  1. 现有的知识蒸馏方法在低资源语言摘要任务中效果有限,且对每个样本的影响未被充分研究。
  2. 本文提出的CHAD和EWAD+CPDP方法通过可靠性感知来优化知识蒸馏,提升了模型的摘要性能。
  3. 实验结果表明,CHAD和EWAD+CPDP在BanSum基准上分别提高了ROUGE-L +0.0173和+0.0219,显著优于标准KD。

📝 摘要(中文)

知识蒸馏(KD)是压缩序列到序列模型的标准方法,但其对每个样本的影响鲜有研究。在BanSum Bangla摘要基准上,标准KD仅将ROUGE-L提高了+0.0003,而约51.3%的训练样本被估计为对学生验证损失有害。为此,本文提出了两种互补的可靠性感知蒸馏方法:CHAD(反事实伤害感知蒸馏)通过与验证损失方向的梯度对齐来衡量每个样本的KD有效性,并训练一个轻量级门控机制;EWAD+CPDP结合了基于token的熵加权自适应蒸馏与来自第二个不兼容词汇教师的容量比例几何约束。在BanSum上,这两种方法均显著优于标准KD,CHAD提高了+0.0173 ROUGE-L,EWAD+CPDP提高了+0.0219 ROUGE-L,且在参数量仅为6000万的情况下,均超越了一个微调的Qwen 2.5-3B模型(大50倍)。

🔬 方法详解

问题定义:本文旨在解决知识蒸馏在低资源语言摘要任务中的有效性问题,现有方法未能充分考虑每个样本对模型性能的影响,导致部分样本可能对验证损失产生负面影响。

核心思路:提出的CHAD和EWAD+CPDP方法通过评估每个样本的可靠性,优化知识蒸馏过程。CHAD通过梯度对齐评估样本的有效性,而EWAD+CPDP则结合了熵加权和容量比例约束,增强了蒸馏的适应性。

技术框架:整体架构包括两个主要模块:CHAD模块用于评估样本的KD有效性并训练门控机制,EWAD+CPDP模块则结合了熵加权和几何约束来优化蒸馏过程。

关键创新:最重要的创新在于引入了样本级别的可靠性评估机制,使得蒸馏过程能够动态调整,避免对有害样本的依赖,从而提升了模型的整体性能。

关键设计:在CHAD中,使用梯度对齐来判断样本的有效性,并设计了轻量级门控机制;在EWAD+CPDP中,采用了熵加权的自适应蒸馏策略,并引入了容量比例几何约束,以确保蒸馏过程的有效性和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CHAD和EWAD+CPDP在BanSum基准上分别将ROUGE-L提高了+0.0173和+0.0219,显著优于标准KD的+0.0003。尽管参数量仅为6000万,但两者均超越了一个微调的Qwen 2.5-3B模型,展示了其在低资源语言摘要任务中的有效性。

🎯 应用场景

该研究的潜在应用领域包括低资源语言的自动摘要生成、机器翻译和信息提取等。通过提高低资源语言模型的性能,能够更好地服务于多语言环境下的信息处理需求,具有重要的实际价值和社会影响。

📄 摘要(原文)

Knowledge distillation (KD) is a standard approach for compressing sequence-to-sequence models, but its per-sample effects are rarely examined. On the BanSum Bangla summarization benchmark, we find that standard KD improves ROUGE-L by only +0.0003 over a cross-entropy baseline, and that approximately 51.3% of training samples are estimated to actively harm student validation loss under standard KD. We propose two complementary reliability-aware distillation methods. CHAD (Counterfactual Harm-Aware Distillation) measures per-sample KD usefulness via gradient alignment with the validation loss direction and trains a lightweight gate that generalizes this counterfactual judgment to the full training set. EWAD+CPDP combines token-level entropy-weighted adaptive distillation with a capacity-proportional geometric constraint from a second, vocabulary-incompatible teacher. On BanSum, both methods substantially outperform standard KD: CHAD by +0.0173 ROUGE-L and EWAD+CPDP by +0.0219 ROUGE-L, where standard KD itself improves ROUGE-L by only +0.0003; despite using only 60M parameters, both outperform a fine-tuned Qwen 2.5-3B model (50x larger). We further evaluate the stronger method, EWAD+CPDP, across 15 typologically diverse XL-Sum languages organised into three sets, beating the CE-only baseline on 10/15 languages; gains are most reliable where the two teachers contribute complementary signal, and weakest where they have saturated or jointly weak target-language coverage. We release code and trained models to support reproducibility and further research on selective distillation.