EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

📄 arXiv: 2607.11012v1 📥 PDF

作者: Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Gengsheng Li, Zhepei Hong, Chang Wu, Pengfei Liu, Junfeng Fang, Xiang Wang

分类: cs.CL

发布日期: 2026-07-13

备注: 10 pages, 2 figures


💡 一句话要点

提出EasyOPD框架以解决语言模型蒸馏中的数据覆盖问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语言模型 在线蒸馏 强化学习 模型适应性 分布式框架

📋 核心要点

  1. 现有的在线蒸馏方法在监督形式、tokenizer兼容性和教师访问等方面存在显著差异,导致实现碎片化,难以复现和扩展。
  2. EasyOPD框架通过将用户配置、监督逻辑和执行分离,提供了一种灵活且易于使用的在线蒸馏解决方案,支持多种蒸馏设置。
  3. 实验结果显示,EasyOPD在多个任务上均能通过同一后端实现不同的目标,且保持任务依赖的性能特征,展现出良好的效果。

📝 摘要(中文)

传统的语言模型蒸馏通常依赖固定的教师生成数据,这可能无法覆盖不断演变的学生策略所遇到的状态。本文提出的EasyOPD框架基于分布式强化学习框架verl,采用在线蒸馏方法,能够在学生生成的回合中收集教师或评估者的监督。EasyOPD将用户配置、特定方法的监督逻辑和基于verl的执行分离,支持多种在线蒸馏设置。实验结果表明,EasyOPD在推理、代码生成、科学知识和工具使用等基准测试中表现优异,且具有良好的可复现性和扩展性。

🔬 方法详解

问题定义:论文旨在解决传统语言模型蒸馏中固定教师数据无法覆盖动态学生策略状态的问题,导致模型性能受限。

核心思路:提出EasyOPD框架,通过在线蒸馏收集学生生成回合中的教师监督,增强模型的适应性和灵活性。

技术框架:EasyOPD框架基于verl,分为用户配置、方法特定监督逻辑和执行模块,支持损失构建、回合元数据、奖励处理、tokenizer对齐和教师计算等功能。

关键创新:EasyOPD的创新在于其模块化设计,允许不同的在线蒸馏方法通过共享后端实现,克服了现有方法的碎片化问题。

关键设计:框架支持多种在线蒸馏设置,包括跨tokenizer OPD、在线自蒸馏和逐步OPD,且提供了可运行的YAML配置和文档,便于用户使用。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,EasyOPD在推理、代码生成和科学知识等任务上均取得了显著提升,具体性能数据和对比基线未在摘要中详细列出,未来研究可进一步验证其效果。

🎯 应用场景

EasyOPD框架具有广泛的应用潜力,尤其在自然语言处理、代码生成和科学计算等领域。通过提高模型的适应性和灵活性,EasyOPD能够帮助研究人员和开发者更高效地训练和优化大型语言模型,推动相关技术的发展。

📄 摘要(原文)

Conventional language-model distillation often relies on fixed teacher-generated data, which may not cover the states encountered by an evolving student policy. On-policy distillation (OPD) instead collects teacher or evaluator supervision on student-generated rollouts. However, existing OPD methods differ substantially in supervision form, tokenizer compatibility, teacher access, and supervision granularity, leading to fragmented implementations that are difficult to reproduce and extend. We present \textsc{EasyOPD}, an on-policy distillation framework built on verl, a distributed reinforcement-learning framework for large language models. \textsc{EasyOPD} separates user-side configuration, method-specific supervision logic, and verl-based execution. Its method modules connect to the shared backend through extension boundaries for loss construction, rollout metadata, reward processing, tokenizer alignment, and teacher-side computation. We instantiate representative methods for three OPD settings -- cross-tokenizer OPD, on-policy self-distillation, and step-wise OPD. Experiments on reasoning, code-generation, scientific-knowledge, and tool-use benchmarks show that these implementations can be executed through the same verl-based backend while retaining their method-specific objectives and task-dependent performance profiles. We release \textsc{EasyOPD} with runnable YAML configurations, documentation, and an installable demonstration package and video.