When Does Muon Help Agentic Reinforcement Learning?

📄 arXiv: 2607.16169 📥 PDF

作者: Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

分类: cs.LG, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出Muon优化算法以提升稀疏奖励强化学习性能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 优化算法 Muon 稀疏奖励 策略优化 优势估计器 学习率调节

📋 核心要点

  1. 现有的强化学习方法在稀疏奖励环境中表现不佳,尤其是在后训练阶段,优化效果有限。
  2. 本文提出在稀疏奖励的自主强化学习中应用Muon优化算法,探索其在不同学习率和优势估计器下的表现。
  3. 实验结果显示,Muon在多个设置下显著提升了验证成功率,尤其在GraphGPO中达到了0.901的高成功率。

📝 摘要(中文)

Muon在大规模预训练中与AdamW竞争,但其在强化学习后训练中的价值尚不明确。本文通过在ALFWorld上与AdamW进行匹配的单种子比较,研究了在稀疏奖励的自主强化学习中使用的原始Muon。在Group-in-Group Policy Optimization (GiGPO)下,仅将Muon应用于隐藏权重矩阵,使最终窗口验证成功率从0.290提升至0.546(+88%);而高频率的AdamW控制在更新后没有成功。结果表明,Muon在自主强化学习中具有潜在的益处,并激励进一步研究策略优化器、优势估计器和学习率的联合影响。

🔬 方法详解

问题定义:本文旨在解决Muon在强化学习后训练中的应用效果不明确的问题,现有方法在稀疏奖励环境中表现不佳,尤其是更新后的成功率低下。

核心思路:论文提出在稀疏奖励的自主强化学习中使用Muon优化算法,特别关注其在不同优势估计器和学习率下的表现,以期提升训练效果。

技术框架:整体架构包括使用Group-in-Group Policy Optimization (GiGPO)进行策略优化,Muon优化算法应用于隐藏权重矩阵,进行多种实验设置以验证效果。

关键创新:最重要的技术创新在于Muon在稀疏奖励强化学习中的应用,尤其是其在不同学习率下的表现显著优于传统的AdamW优化器。

关键设计:在实验中,设置了不同的学习率(如3e-5和1e-5),并使用了多种优势估计器(如GRPO和GraphGPO),以评估Muon的效果和性能提升。实验结果显示,Muon在多个设置下均表现出色。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Muon在GiGPO下将最终窗口验证成功率从0.290提升至0.546,提升幅度达到88%。在1e-5的学习率下,GraphGPO Muon达到了0.901的成功率,并将标准化验证AUC从0.399提升至0.556,显示出显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、游戏AI和自动驾驶等需要强化学习的场景。通过提升稀疏奖励环境下的学习效率,Muon优化算法有助于加速智能体的训练过程,降低对大量标注数据的依赖,具有重要的实际价值和未来影响。

📄 摘要(原文)

Muon is competitive with AdamW in large-scale pre-training, but its value for reinforcement-learning (RL) post-training remains unclear. We study vanilla Muon in sparse-reward agentic RL through matched single-seed comparisons with AdamW on ALFWorld using Qwen2.5-0.5B-Instruct. Under Group-in-Group Policy Optimization (GiGPO), applying Muon only to hidden weight matrices raises final-window validation success from 0.290 to 0.546 (+88%); high-rate AdamW controls retain no post-update success. The effect depends on the advantage estimator and learning rate. At 3e-5, Muon improves GRPO from 0.161 to 0.268, whereas GraphGPO's late-window gap narrows near saturation. At 1e-5, GraphGPO Muon reaches 0.901, raises normalized validation AUC from 0.399 to 0.556, and reaches 0.5 and 0.75 success 30 and 60 updates earlier, respectively. These exploratory results show that Muon can benefit agentic RL and motivate studying the policy optimizer, advantage estimator, and learning rate jointly. Multi-seed and cross-task validation remain open.