Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation

📄 arXiv: 2609.09135v1 📥 PDF

作者: Jiacheng Xu, Feng Chen, Xiuneng Xu, Bo An

分类: cs.LG, cs.CL

发布日期: 2026-09-08

备注: Accepted to EMNLP 2026 Main Conference. 15 pages, 4 figures, 11 tables


💡 一句话要点

提出探针驱动的熵正则化排名掩蔽策略优化以解决代码生成中的测试时强化学习问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 测试时强化学习 代码生成 探针驱动 奖励优化 熵正则化 策略优化 行为一致性

📋 核心要点

  1. 现有的测试时强化学习方法在代码生成任务中面临挑战,无法从程序的表面形式中获取有效的训练信号。
  2. 论文提出探针驱动的TTRL,通过构建探针输入和定义探针共识奖励,解决了代码生成中的奖励获取问题。
  3. 实验结果表明,ERPO在编码基准测试中显著提升了pass@1和pass@k的表现,验证了其有效性。

📝 摘要(中文)

现有的测试时强化学习(TTRL)方法通过对无标签测试任务的答案级自投票来获取奖励,但在代码生成中,由于程序无法通过表面形式进行比较,因此无法直接提供可用的训练信号。为使TTRL适用于代码生成,我们提出了探针驱动的TTRL,该方法从问题陈述构建无输出的探针输入,并在这些探针上执行候选程序,从而定义了基于行为一致性的探针共识奖励(PCR)。然而,PCR并不是一个完全可靠的验证器,容易受到虚假共识的奖励操控。因此,我们引入了熵正则化排名掩蔽策略优化(ERPO),将低PCR转化为保守的负更新,并通过熵上限控制策略漂移。在编码基准测试中,ERPO在领域内适应和零样本迁移中显著提高了pass@1和pass@k的表现。

🔬 方法详解

问题定义:本论文旨在解决测试时强化学习在代码生成中的应用问题。现有方法依赖于答案级自投票,但代码生成的程序无法通过表面形式进行有效比较,导致训练信号不足。

核心思路:论文提出探针驱动的TTRL,构建无输出的探针输入,通过执行候选程序并根据行为一致性定义探针共识奖励(PCR),为开放词汇程序提供行为训练信号。

技术框架:整体架构包括探针输入的构建、候选程序的执行、PCR的计算以及熵正则化排名掩蔽策略优化(ERPO)的实施。主要模块包括探针生成模块、程序执行模块和奖励优化模块。

关键创新:引入熵正则化排名掩蔽策略优化(ERPO),将低PCR转化为保守的负更新,并通过熵上限控制策略漂移,这是与现有方法的本质区别。

关键设计:在ERPO中,设置了熵上限以防止策略漂移,并通过排名掩蔽机制来处理低PCR的情况,确保训练过程的稳定性和有效性。具体的损失函数和参数设置在实验中进行了详细调优。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在编码基准测试中,ERPO方法在pass@1和pass@k指标上显著提升,具体表现为在领域内适应和零样本迁移中均取得了优异的结果,验证了其在代码生成任务中的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括自动代码生成、智能编程助手和软件开发工具。通过提高代码生成的准确性和效率,能够显著提升开发者的工作效率,降低编程错误的发生率,具有重要的实际价值和未来影响。

📄 摘要(原文)

Existing methods for test-time reinforcement learning (TTRL) derive rewards from answer-level self-voting on unlabeled test-time tasks with canonical answers, but this breaks down for code generation because programs cannot be compared by surface form and therefore do not directly provide a usable training signal. To make TTRL applicable to code generation, we propose probe-driven TTRL, which constructs output-free probe inputs from the problem statement, executes candidate programs on these probes, and defines a Probe Consensus Reward (PCR) from the resulting behavioral agreement. PCR provides a behavioral training signal for open-vocabulary programs, but it is not a fully reliable verifier and remains susceptible to reward hacking through spurious consensus. We therefore introduce Entropy-Regularized Rank-Masked Policy Optimization (ERPO), which converts low PCR into conservative negative updates through rank masking and controls policy drift with an entropy ceiling. On coding benchmarks, ERPO substantially improves pass@1 and pass@k in both in-domain adaptation and zero-shot transfer.