Distillation as Probability Transport: Routed On-Policy Distillation
作者: Tianle Xia, Lingxiang Hu, Yiding Sun, Linfang Shang, Ming Xu, Lan Xu, Ning Zheng, Wei Xu, Jie Jiang
分类: cs.LG, cs.CL
发布日期: 2026-09-08
💡 一句话要点
提出RouteOPD以解决现有蒸馏方法的概率重分配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 政策蒸馏 概率传输 教师-学生模型 强化学习 知识转移
📋 核心要点
- 现有的政策蒸馏方法在处理教师知识转移时,未能有效地重分配概率,导致信息损失。
- 本文提出RouteOPD,通过将教师-学生不一致性分解为明确的传输对,优化概率传输过程。
- 实验结果显示,RouteOPD在多个基准测试中表现优异,相较于传统方法有显著提升。
📝 摘要(中文)
在政策蒸馏(OPD)中,教师知识通过学生生成的轨迹进行转移,但高效的采样目标将教师分布简化为单个标记的标量信用。这种信用指示了标记应增加或减少的概率,但未明确相应的重分配。本文将OPD重新表述为教师引导的概率传输,并提出RouteOPD(路由政策蒸馏),将局部教师-学生不一致性分解为学生过剩源和教师不足目标,并将其耦合为明确的传输对。RouteOPD优化成对的对数赔率,以实现从有界教师潜力获得的共同可实现目标,同时根据教师需求的集中度调整传输预算。实验结果表明,RouteOPD在四个教师-学生设置和四个数学推理基准上始终优于采样反向KL OPD,且伴随更高的路由保真度和更低的背景泄漏。这些结果证明了在政策蒸馏中显式建模概率传输的有效性。
🔬 方法详解
问题定义:本文旨在解决现有政策蒸馏方法中教师知识转移的效率问题,尤其是在概率重分配方面的不足,导致信息损失和性能下降。
核心思路:论文提出的RouteOPD方法通过将教师-学生之间的意见不一致性分解为学生过剩和教师不足的明确传输对,从而优化概率传输过程,确保信息的有效转移。
技术框架:RouteOPD的整体架构包括教师潜力的界定、学生生成轨迹的采样、以及基于对数赔率的优化过程。主要模块包括教师知识的提取、传输对的构建和概率更新机制。
关键创新:RouteOPD的核心创新在于将教师引导的概率传输显式建模,区别于传统方法的简单信用分配,提供了更为精细的概率重分配机制。
关键设计:在RouteOPD中,设计了针对教师需求的传输预算调整机制,并采用了成对的对数赔率损失函数,以确保更新方向和幅度符合教师的偏好。具体参数设置和网络结构细节未在摘要中明确给出,属于未知领域。
🖼️ 关键图片
📊 实验亮点
实验结果表明,RouteOPD在四个教师-学生设置和四个数学推理基准上均优于传统的采样反向KL OPD,具体表现为更高的路由保真度和更低的背景泄漏,提升幅度显著,具体性能数据未在摘要中给出,属于未知领域。
🎯 应用场景
该研究的潜在应用领域包括强化学习、自然语言处理和计算机视觉等领域,尤其是在需要高效知识转移的场景中。通过优化教师知识的传递方式,RouteOPD有望提升模型的学习效率和性能,具有重要的实际价值和未来影响。
📄 摘要(原文)
On-policy distillation (OPD) transfers teacher knowledge on student-generated trajectories, but efficient sampled objectives reduce the teacher distribution to scalar credit on individual tokens. Such credit indicates whether a token should gain or lose probability, yet leaves the corresponding redistribution unspecified. We recast OPD as teacher-guided probability transport and propose RouteOPD (Routed On-Policy Distillation), which decomposes local teacher--student disagreement into student-excess sources and teacher-deficit destinations and couples them into explicit transport pairs. RouteOPD optimizes pairwise log-odds toward jointly realizable targets obtained from a bounded teacher potential, while adapting the transport budget to the concentration of teacher demand. This formulation directs updates toward teacher-preferred destinations and controls their magnitude within a single transport operator. Experiments across four teacher--student settings and four mathematical-reasoning benchmarks demonstrate that RouteOPD consistently outperforms sampled reverse-KL OPD, with improvements accompanied by higher routing fidelity and lower background leakage. These results demonstrate the effectiveness of explicitly modeling probability transport in on-policy distillation.