SLPO: Scaling Latent Reasoning via a Surrogate Policy
作者: Runyang You, Zhiyuan Liu, Yongqi Li, Wenjie Li
分类: cs.CL, cs.AI, cs.LG
发布日期: 2026-07-22
💡 一句话要点
提出SLPO以解决潜在推理中的奖励优化问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 潜在推理 强化学习 奖励优化 自回归模型 轨迹评估
📋 核心要点
- 现有的显式思维链推理方法在计算上成本高,且每个中间步骤都需解码为语言标记,导致效率低下。
- 论文提出SLPO,通过经验替代策略密度和正确性监督停止头,将结果奖励强化学习引入潜在推理器,优化了推理过程。
- 实验结果表明,SLPO在并行采样下显著提高了Pass@$k$,并能将更多计算资源分配给更复杂的实例,提升了准确性。
📝 摘要(中文)
具有可验证奖励的强化学习已成为显式思维链推理器在测试时扩展的主要方法。然而,这一扩展路径计算成本高,因为每个中间步骤必须解码为语言标记。潜在推理通过连续向量承载中间计算,且在较短的时间范围内已达到或超越显式思维链的表现。尽管潜在推理具有潜力,但仍然主要依赖模仿,而显式思维链已经通过结果奖励强化学习超越了模仿。潜在轨迹缺乏可处理的逐步似然性和在固定思维预算下的自适应停止接口,因此结果奖励无法引导潜在测试时的扩展。我们提出了替代潜在策略优化(SLPO),将结果奖励强化学习引入自回归潜在推理器:在轨迹级别进行信用分配的经验替代策略密度,以及一个通过结果奖励优化精炼为可变时间范围策略的正确性监督停止头。在连续和软思维设置下,SLPO在并行采样下提高了Pass@$k$,并将更长的潜在计算分配给更难的实例,以提高确定性准确性。
🔬 方法详解
问题定义:论文要解决的问题是如何在潜在推理中有效引入结果奖励强化学习,以克服现有方法在计算效率和灵活性上的不足。现有的潜在推理方法主要依赖模仿,缺乏有效的奖励机制来引导推理过程。
核心思路:论文的核心思路是引入替代潜在策略优化(SLPO),通过构建经验替代策略密度来实现轨迹级别的信用分配,并设计一个正确性监督的停止机制,以便在固定的思维预算下优化推理过程。
技术框架:整体架构包括两个主要模块:经验替代策略密度模块用于评估潜在轨迹的质量,正确性监督停止头用于动态调整推理的时间范围。通过这两个模块的协同工作,SLPO能够在不同的思维设置下自适应地优化推理过程。
关键创新:最重要的技术创新点在于将结果奖励强化学习引入潜在推理器,打破了潜在推理依赖模仿的局限性,使得潜在推理能够在更复杂的任务中表现出更高的灵活性和准确性。
关键设计:在设计中,SLPO采用了动态调整的停止机制,结合了奖励信号和轨迹质量评估,确保在固定思维预算下能够有效分配计算资源。此外,损失函数的设计也考虑了轨迹的正确性和奖励的反馈,以实现更好的优化效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SLPO在并行采样下的Pass@$k$表现显著提升,具体提升幅度达到XX%(具体数据未知),并且在处理更复杂实例时,能够有效分配更长的潜在计算时间,从而提高确定性准确性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能对话系统和自动推理等。通过提高潜在推理的效率和准确性,SLPO可以在需要快速响应和高准确度的场景中发挥重要作用,推动智能系统的进一步发展。
📄 摘要(原文)
Reinforcement learning with verifiable rewards has become the predominant recipe for eliciting test-time scaling in explicit Chain-of-Thought reasoners. Yet this scaling path remains computationally costly, since every intermediate step must be decoded as a language token. Latent reasoning instead carries intermediate computation as continuous vectors and already matches or surpasses explicit CoT at far shorter horizons. Despite this promise, latent reasoners remain largely imitation-bound, while explicit CoT has already moved past imitation via outcome-reward RL. Latent trajectories lack a tractable per-step likelihood and an adaptive stopping interface under fixed thinking budgets, so outcome rewards cannot elicit latent test-time scaling. We introduce Surrogate Latent Policy Optimization (SLPO) to bring outcome-reward RL to autoregressive latent reasoners: an empirical surrogate policy density over latent transitions for trajectory-level credit assignment, and a correctness-supervised stopping head that outcome-reward optimization refines into a variable-horizon policy. Across continuous and soft thinking settings, SLPO improves Pass@$k$ under parallel sampling and allocates longer latent computation to harder instances with higher deterministic accuracy.