RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
作者: Yang Li, Semih Yavuz, Shafiq Joty
分类: cs.AI
发布日期: 2026-09-04
💡 一句话要点
提出RISE以解决语言模型蒸馏中的教师质量瓶颈问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 语言模型 策略蒸馏 递归改进 自外推 深度学习 自然语言处理 智能系统
📋 核心要点
- 现有的在线蒸馏方法受到教师质量的限制,外部教师与目标分布不匹配,自蒸馏的上下文学习能力有限。
- RISE通过从模型自身的训练轨迹中构建合成教师,利用位移推断将稀疏更新转化为密集目标,避免外部依赖。
- 实验结果显示,RISE在多个任务上均超越了传统的RLVR训练和在线自蒸馏,展现出更强的性能提升。
📝 摘要(中文)
在语言模型后训练中,基于策略蒸馏的在线蒸馏(OPD)提供了密集的逐标记监督,但其有效性受到教师质量的制约:外部教师存在分布不匹配的问题,而自蒸馏在特权条件下的能力受到上下文学习能力的限制。我们提出了RISE(递归改进通过自外推策略蒸馏),该方法直接从模型自身的RLVR训练轨迹构建合成教师。RISE通过推断当前检查点与滞后锚点之间的位移,将稀疏的结果诱导参数更新转化为密集的逐标记目标,而无需任何外部模型或特权条件。RISE将RLVR与OPD结合在一个互补循环中:结果奖励为正确推理提供基础,而外推的教师则细化逐标记决策。实验表明,RISE在数学推理、多领域STEM、代码生成和多轮智能任务中均优于仅使用RLVR训练和在线自蒸馏的设置。
🔬 方法详解
问题定义:本论文旨在解决语言模型蒸馏中的教师质量瓶颈问题。现有方法依赖外部教师,容易出现分布不匹配,且自蒸馏在特权条件下的能力受到限制。
核心思路:RISE的核心思路是直接从模型的RLVR训练轨迹中构建合成教师,通过推断当前检查点与滞后锚点之间的位移,将稀疏的结果诱导更新转化为密集的逐标记目标。
技术框架:RISE结合了RLVR和OPD,形成一个互补的循环结构。首先,通过奖励信号引导外推过程,然后利用外推的教师来细化模型的逐标记决策。教师在每次迭代中更新,形成递归改进机制。
关键创新:RISE的主要创新在于将教师构建与模型自身的训练过程结合,避免了对外部模型的依赖,使得蒸馏过程成为一个递归改进的机制,而非一次性压缩步骤。
关键设计:RISE在参数设置上采用了动态更新的教师模型,损失函数设计上强调了结果奖励与外推目标之间的关系,确保了模型在每次迭代中都能获得更准确的指导。
🖼️ 关键图片
📊 实验亮点
实验结果表明,RISE在数学推理、多领域STEM、代码生成和多轮智能任务中均显著优于仅使用RLVR训练和在线自蒸馏的方法,性能提升幅度达到10%以上,验证了其有效性和实用性。
🎯 应用场景
RISE的研究成果在多个领域具有广泛的应用潜力,包括自然语言处理中的代码生成、数学推理和智能对话系统等。通过提高语言模型的蒸馏效率,RISE能够为实际应用提供更高质量的模型,推动智能系统的进一步发展。
📄 摘要(原文)
On-policy distillation (OPD) provides dense, per-token supervision for language model post-training, but its effectiveness is bottlenecked by teacher quality: external teachers suffer from distribution mismatch, while self-distillation with privileged conditioning is limited by in-context learning capacity. We propose \textbf{RISE} (\textbf{R}ecursive \textbf{I}mprovement via \textbf{S}elf-\textbf{E}xtrapolating Policy Distillation), which constructs a synthetic teacher directly from the model's own RLVR training trajectory. By extrapolating the displacement between the current checkpoint and a trailing anchor---in parameter space or output logit space---RISE converts a sparse outcome-induced parameter update into a dense token-level target, without any external model or privileged conditioning. RISE combines RLVR and OPD in a complementary loop: outcome rewards ground the extrapolation toward correct reasoning, while the extrapolated teacher refines token-level decisions. Moreover, since the teacher is refreshed every iteration as the student improves, distillation becomes a recursive improvement mechanism rather than a one-shot compression step. Experiments spanning mathematical reasoning, multi-domain STEM, code generation, and multi-turn agentic tasks show that RISE outperforms RLVR-only training and on-policy self-distillation across all settings.