QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization
作者: Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui
分类: cs.AI
发布日期: 2026-07-23
备注: 18 pages, 7 figures, 6 tables. Accepted at COLM 2026
💡 一句话要点
提出QLPO以解决长链推理模型的响应长度控制问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长链推理 响应长度控制 强化学习 重采样 策略优化 自然语言处理 模型训练
📋 核心要点
- 现有方法在控制长链推理模型的响应长度时,往往依赖显式惩罚,导致推理质量下降。
- QLPO通过重采样策略,隐式控制响应长度,避免了对奖励函数的修改,简化了调优过程。
- 实验结果显示,QLPO在多种模型上均能有效减少响应长度,同时保持推理准确性,提升幅度显著。
📝 摘要(中文)
近年来,大型推理模型在强化学习中常常生成较长的思维链响应,导致推理延迟和部署成本增加。现有的响应长度控制方法通常依赖于显式的长度惩罚或额外的控制模块,这需要精细调优,可能会影响推理质量。本文提出了基于象限加权采样的长度感知策略优化方法(QLPO),这是一种简单的重采样变体,能够在不修改奖励函数的情况下引入隐式长度控制。QLPO首先过生成候选响应,然后通过保留经验正确/错误比例,同时偏向短的正确响应和长的错误响应,重新采样训练组。这种方法重塑了训练分布,隐式鼓励模型输出更短的响应。在1.5B到32B参数范围内的多种模型中,QLPO在准确性与长度的权衡上均表现出一致的提升,响应长度减少了30%到70%,同时保持了推理性能。
🔬 方法详解
问题定义:本文旨在解决大型推理模型在强化学习中生成长响应所带来的推理延迟和成本问题。现有方法通常依赖显式的长度惩罚,导致推理质量受损,且调优复杂。
核心思路:QLPO的核心思路是通过重采样策略引入隐式长度控制,避免对奖励函数的直接修改。这种方法通过调整训练样本的分布,鼓励生成更短的响应。
技术框架:QLPO的整体架构包括两个主要阶段:首先是过生成候选响应,其次是根据经验正确/错误比例进行重采样,重点保留短的正确响应和长的错误响应。
关键创新:QLPO的创新在于其重采样机制,通过调整样本分布来实现长度控制,与传统方法相比,减少了对奖励函数的依赖,简化了模型训练过程。
关键设计:在QLPO中,重采样过程通过计算正确和错误响应的比例来进行,确保在训练中保留有效信息,同时设置了适当的超参数以优化采样效果。具体的损失函数设计和网络结构细节在实验中进行了验证。
🖼️ 关键图片
📊 实验亮点
实验结果表明,QLPO在多个模型上均实现了30%到70%的响应长度减少,同时保持推理性能不变。这一结果显著优于现有的长度控制方法,展示了QLPO在准确性与效率之间的良好平衡。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和智能助手等。通过有效控制响应长度,QLPO能够提升用户体验,降低系统资源消耗,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Recent large reasoning models often develop long chain-of-thought responses during reinforcement learning (RL), resulting in high inference latency and deployment cost. Existing methods for response length control typically rely on explicit length penalties or additional control modules, which require careful tuning and may compromise reasoning quality. We propose Quadrant-weighted Sampling for Length-aware Policy Optimization (QLPO), a simple resampling-based variant of GRPO that introduces implicit length control without modifying the reward function. QLPO first over-generates candidate responses and then resamples the training group by preserving the empirical correct/incorrect ratio while favoring short correct responses and long incorrect responses. This reshapes the training distribution and implicitly encourages shorter model outputs. Across models ranging from 1.5B to 32B parameters, including both base models and strong reasoning models, QLPO consistently improves the accuracy-length trade-off. It reduces response length by 30% to 70% while preserving reasoning performance. These results suggest that structured resampling provides an effective and robust approach to efficient reasoning.