Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback
作者: Patrick Wilhelm, Odej Kao
分类: cs.LG, cs.CL
发布日期: 2026-07-15
💡 一句话要点
提出FLOP会计框架优化RL后训练资源分配问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化学习 后训练 资源分配 FLOP会计 模型优化 反馈机制 机器人学习
📋 核心要点
- 现有的RL后训练方法在资源分配上存在不足,通常只关注总FLOP预算,而忽视了如何有效分配计算资源的问题。
- 本文提出了一种FLOP会计框架,能够将计算资源分解为回滚/搜索、策略更新和奖励模型评估,从而优化后训练过程中的资源分配。
- 通过对LoRA适应的Qwen2.5策略的实验,发现最佳的资源分配策略与模型大小、计算预算和奖励系统密切相关,提供了新的见解。
📝 摘要(中文)
强化学习(RL)后训练日益被用于适应基础模型以进行推理、规划和反馈驱动的机器人学习流程,但受限的后训练资源通常仅用总FLOP预算来概括。本文研究了在相同后训练预算下,如何在更大策略、较小策略的长时间训练、更多的回滚搜索或更强的奖励反馈之间进行决策。我们引入了一个FLOP会计框架,分解计算为回滚/搜索、策略更新/学习和奖励或反馈模型评估。通过对LoRA适应的Qwen2.5策略的研究,我们发现最佳资源分配受模型大小、计算预算、奖励系统和评估目标的影响。相同FLOP的模型大小比较显示,模型选择与训练分配是耦合的,因为较大的策略在相同预算下消耗更多的每个token计算。奖励系统也改变了会计方式,基于规则的奖励几乎将所有非更新计算用于策略回滚,而PRM风格的反馈则将预算的一部分分配给奖励模型推理。我们提出RACE作为一种诊断性试点网格协议,用于在昂贵的验证运行之前识别分配机制。我们的结果表明,RL后训练论文应报告总FLOP及其在模型大小、搜索、学习和反馈之间的分配。
🔬 方法详解
问题定义:本文旨在解决在相同后训练预算下,如何在不同策略大小、训练时间、回滚搜索和奖励反馈之间进行有效的资源分配。现有方法往往只关注总FLOP预算,未能深入分析资源分配的细节。
核心思路:论文提出的FLOP会计框架通过将计算资源分解为不同模块,帮助研究者理解和优化后训练过程中的资源使用。通过这种方式,可以根据具体情况调整资源分配策略,以实现最佳性能。
技术框架:整体架构包括三个主要模块:回滚/搜索、策略更新/学习和奖励模型评估。每个模块的计算需求被明确分开,从而使得研究者能够清晰地看到每个部分对整体性能的贡献。
关键创新:最重要的技术创新在于引入了FLOP会计框架,使得在资源有限的情况下能够更灵活地进行计算资源的分配。这与传统方法的单一预算视角形成鲜明对比。
关键设计:在实验中,采用了LoRA适应的Qwen2.5策略,并通过不同的奖励系统进行比较。关键参数设置包括模型大小、计算预算和反馈机制的设计,确保了实验结果的有效性和可比性。通过这些设计,能够更好地理解不同资源分配策略的影响。
🖼️ 关键图片
📊 实验亮点
实验结果表明,最佳资源分配策略随着模型大小和计算预算的变化而变化。通过对LoRA适应的Qwen2.5策略的比较,发现较大的策略在相同预算下消耗更多计算,导致更新和回滚次数减少。奖励系统的不同设计也显著影响了计算资源的使用效率,提供了新的优化方向。
🎯 应用场景
该研究的潜在应用领域包括机器人学习、智能系统优化和强化学习算法的改进。通过优化后训练资源的分配,可以提高模型在实际应用中的适应性和效率,推动智能系统在复杂环境中的表现。未来,该框架可能会被广泛应用于各种需要高效计算资源管理的领域。
📄 摘要(原文)
Reinforcement Learning (RL) post-training is increasingly used to adapt foundation models for reasoning, planning, and feedback-driven robot-learning pipelines, but constrained post-training resources are often summarized by a single total FLOP budget. We study the fixed-budget decision problem behind this practice: under the same post-training budget, should one use a larger policy, train a smaller policy longer, generate more rollout search, or spend compute on stronger reward feedback? We introduce a FLOP-accounting framework for GRPO post-training that decomposes compute into rollout/search, policy-update/learning, and reward- or feedback-model evaluation. Across LoRA-adapted Qwen2.5 policies, we find conditional allocation frontiers: the best observed allocation changes with model size, compute budget, reward system, and evaluation target. Same-FLOP model-size comparisons show that model choice and training allocation are coupled because larger policies consume more per-token compute and therefore buy fewer updates or rollouts under the same budget. Reward systems also change the accounting: rule-based rewards spend nearly all non-update compute on policy rollouts, while PRM-style feedback allocates a visible part of the budget to reward-model inference. We present RACE as a diagnostic pilot-grid protocol, not a guarantee of held-out improvement, for identifying allocation regimes before expensive validation runs; our results suggest that RL post-training papers should report total FLOPs together with how compute is divided among model size, search, learning, and feedback.