Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards
作者: Yuxuan Zhu, Rohan Alur, Daniel Kang
分类: cs.LG, cs.AI
发布日期: 2026-07-16
备注: 22 pages, 7 figures
💡 一句话要点
提出非空泛的强化学习泛化界限以解决可验证奖励问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 可验证奖励 强化学习 泛化界限 模型压缩 TinyLoRA 在线策略蒸馏 Gumbel-max
📋 核心要点
- 现有的可验证奖励强化学习方法在模型的泛化能力方面存在不足,导致其在不同任务上的表现不稳定。
- 本文提出了一种新的渐进式RLVR框架,通过结合在线策略蒸馏和模型量化,提升了模型的压缩效率和泛化能力。
- 实验结果表明,渐进式RLVR在多个领域中实现了84-97%的性能保留,同时模型压缩率提升至14,796倍,泛化界限显著优于基础模型。
📝 摘要(中文)
尽管可验证奖励的强化学习(RLVR)广泛用于提升大型语言模型(LLMs)的推理能力,但其模型的泛化能力仍然不够明确。本文首次建立了在十亿参数规模下进行参数高效的RLVR微调的非空泛泛化界限。我们的方法将PAC-Bayes压缩界限适应于此设置,并通过应用Gumbel-max重参数化技巧来解决令牌生成的内在随机性。为实现这些界限,我们提出了渐进式RLVR框架,该框架将RLVR与在线策略蒸馏、TinyLoRA和模型量化相结合。渐进式RLVR在保持标准LoRA微调84-97%性能的同时,生成的模型压缩率提高了14,796倍。我们展示了该框架在数学问题解决、编程、常识推理和文本到SQL四个领域中产生了非空泛的泛化界限。我们的界限超越了基础模型9-51%的准确率,并在微调模型的准确率范围内6-11%。
🔬 方法详解
问题定义:本文旨在解决可验证奖励的强化学习(RLVR)在泛化能力方面的不足,尤其是在大规模模型微调时的表现不稳定性。现有方法未能提供有效的泛化界限,限制了其在实际应用中的有效性。
核心思路:我们通过适应PAC-Bayes压缩界限的方法,结合Gumbel-max重参数化技巧,来应对令牌生成过程中的随机性,从而建立非空泛的泛化界限。
技术框架:渐进式RLVR框架整合了RLVR、在线策略蒸馏、TinyLoRA和模型量化,形成一个多层次的训练和压缩流程。该框架通过逐步优化模型参数和结构,提升了模型的压缩率和泛化能力。
关键创新:本文的主要创新在于首次提出了非空泛的泛化界限,显著提高了RLVR在大规模模型微调中的有效性,与传统方法相比,提供了更为可靠的性能保证。
关键设计:在模型设计中,我们采用了TinyLoRA进行参数高效的微调,并通过量化技术进一步提升模型的压缩率。损失函数和训练策略经过精心设计,以确保在不同任务中保持高性能。
🖼️ 关键图片
📊 实验亮点
实验结果显示,渐进式RLVR框架在多个领域中实现了84-97%的性能保留,同时模型压缩率提升至14,796倍。我们的泛化界限超越基础模型9-51%的准确率,并在微调模型的准确率范围内6-11%,展现了显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、编程辅助工具和智能问答系统等。通过提升模型的泛化能力和压缩效率,研究成果能够在资源受限的环境中实现更高效的推理和决策,具有重要的实际价值和广泛的未来影响。
📄 摘要(原文)
While reinforcement learning with verifiable rewards (RLVR) is widely used to improve the reasoning capabilities of large language models (LLMs), the generalizability of the resulting models remains poorly understood. In this work, we establish the first non-vacuous generalization bounds for parameter-efficient RLVR fine-tuning at the billion-parameter scale. Our approach adapts PAC-Bayes compression bounds to this setting, and addresses the inherent stochasticity of token generation by applying the Gumbel-max reparameterization trick. To operationalize these bounds, we propose the Progressive RLVR framework, which integrates RLVR with on-policy distillation, TinyLoRA, and model quantization. Progressive RLVR empirically retains 84-97% performance of standard LoRA fine-tuning while producing models that are 14,796x more compressible. We show that this framework yields non-vacuous generalization bounds in four domains: mathematical problem-solving, programming, general-knowledge reasoning, and Text-to-SQL. Our bounds exceed the accuracy of the base model by 9-51% and lie within 6-11% of the accuracy of the fine-tuned models.