Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

📄 arXiv: 2607.19313v1 📥 PDF

作者: Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

分类: cs.LG, cs.AI

发布日期: 2026-07-21

备注: 24 Pages


💡 一句话要点

提出Off-Context GRPO以解决强化学习中的学习信号缺失问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 可验证奖励 引导回放 重要性校正 数学推理 模型训练 人工智能

📋 核心要点

  1. 现有的强化学习与可验证奖励方法在面对复杂问题时,无法提供有效的学习信号,导致模型训练停滞。
  2. 本文提出的Off-Context GRPO方法通过引导回放,结合重要性校正目标,旨在引导模型朝向正确解的方向进行学习。
  3. 实验结果显示,OC-GRPO在标准数学推理基准上相较于传统GRPO实现了3.9%的绝对提升,且额外计算成本几乎可以忽略。

📝 摘要(中文)

强化学习与可验证奖励(RLVR)在大型语言模型中的推理能力有所提升。然而,现有的RLVR方法在处理困难问题时表现不佳:当模型无法生成任何正确解时,学习信号为零。通过在训练过程中提供特权指导(如解的前缀),可以帮助模型克服这一学习瓶颈。本文提出了Off-Context GRPO(OC-GRPO),该方法在最小修改GRPO的基础上,利用引导回放并应用重要性校正目标,确保更新回归到原始无指导目标,从而避免了未校正引导训练的不稳定性。实验证明,该算法在标准数学推理基准上平均提高了3.9%的绝对性能(相对增益为13.8%),且额外成本微乎其微。

🔬 方法详解

问题定义:本文旨在解决强化学习中,当模型无法生成正确解时,学习信号为零的问题。这种情况导致模型无法有效学习,尤其是在处理复杂问题时,现有方法的表现不尽如人意。

核心思路:OC-GRPO的核心思路是通过提供特权指导(如解的前缀)来生成引导回放,从而为模型提供非零的学习信号。通过重要性校正目标,确保模型更新能够回归到原始的无指导目标,避免了引导训练的不稳定性。

技术框架:OC-GRPO的整体架构包括两个主要阶段:首先,使用特权信息生成引导回放;其次,应用重要性校正目标进行模型更新。该框架确保了模型在学习过程中能够有效利用引导信息,同时保持对原始目标的关注。

关键创新:OC-GRPO的主要创新在于引入了重要性校正目标,这一设计有效解决了传统引导训练中存在的目标不匹配问题,使得模型在学习过程中更加稳定。与现有方法相比,OC-GRPO能够在保持引导信息的同时,确保模型的学习方向与原始目标一致。

关键设计:在OC-GRPO中,关键的参数设置包括引导回放的生成策略和重要性校正的计算方式。此外,损失函数的设计也经过精心调整,以确保模型在更新时能够平衡引导信息与原始目标之间的关系。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

OC-GRPO在标准数学推理基准上实现了3.9%的绝对性能提升,相较于传统GRPO表现出13.8%的相对增益,且在计算成本上几乎没有增加,显示出其高效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能问答系统及其他需要推理能力的人工智能应用。通过提升模型在复杂问题上的推理能力,OC-GRPO有望在实际应用中显著提高系统的性能和用户体验,推动智能系统的进一步发展。

📄 摘要(原文)

Reinforcement learning with verifiable rewards (RLVR) improves reasoning in large language models. Yet, typical RLVR approaches fail on difficult problems: when a model cannot generate any correct solutions, it receives \textit{zero} learning signal. Providing privileged guidance during training, such as solution prefixes, can help overcome this learning cliff by steering the model towards {correct solutions with non-zero reward}. {We call these rollouts \textit{off-context}: they are generated from a training prompt that contains privileged guidance, while the target objective is defined by the original prompt without that guidance.} {We introduce} Off-Context GRPO (OC-GRPO), a minimally modified variant of GRPO that uses guided rollouts but applies an importance-corrected objective to steer the update back toward the original unguided objective, avoiding the mismatch that destabilizes uncorrected guided training. Empirically, our algorithm achieves a 3.9\% absolute improvement (13.8\% relative gain) over vanilla GRPO on average across standard mathematical reasoning benchmarks with negligible additional cost.