SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs

📄 arXiv: 2609.08452v1 📥 PDF

作者: Shengtian Yang, Ziyu Xiong, Yu Li, Yewen Li, Qingpeng Cai, Lei Feng

分类: cs.AI

发布日期: 2026-09-08


💡 一句话要点

提出SRPO以解决多智能体LLMs的联合优化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多智能体系统 强化学习 大型语言模型 联合优化 策略优化

📋 核心要点

  1. 现有的强化学习方法在多智能体环境中优化响应时,未能考虑多个输出共同导致状态转移的问题,导致更新单位不一致。
  2. SRPO方法将多个输出视为一个整体,通过组合对数比率和相对优势来优化多智能体的联合行为,提升了优化效率。
  3. 在数学推理和多轮搜索的实验中,SRPO在不同模型规模下均取得了最强的宏平均结果,展示了其优越的性能和稳定性。

📝 摘要(中文)

多智能体大型语言模型通过协调多个策略在共享环境中解决复杂任务。然而,现有的强化学习方法通常分别优化每个响应或轨迹,导致更新单位与系统执行的动作不一致。为了解决这一问题,本文提出了SRPO(Setwise Relative Policy Optimization),将一个状态转移所需的最小输出集视为一个多智能体动作。SRPO通过将成员对数比率组合成一个基于基数归一化的集合比率,分配一个相对优势,并进行一次剪切,从而统一了不同集合大小的劳动分工和联合共同进化。实验结果表明,该方法在数学推理和多轮搜索任务中表现优异,具有较强的稳定性。

🔬 方法详解

问题定义:本文旨在解决多智能体大型语言模型在状态转移时,现有强化学习方法未能有效联合优化多个输出的问题。现有方法通常独立优化每个响应,导致更新单位与实际执行动作不一致。

核心思路:SRPO方法的核心思想是将多个输出视为一个整体的多智能体动作,通过组合输出的对数比率来优化策略,从而实现更有效的联合优化。这样的设计能够更好地反映多个输出之间的相互作用。

技术框架:SRPO的整体架构包括三个主要模块:首先,收集多个输出的对数比率;其次,计算基于基数归一化的集合比率;最后,分配相对优势并进行一次剪切,以形成最终的优化策略。

关键创新:SRPO的主要创新在于将多个输出视为一个集合进行优化,这与传统方法逐个优化的方式本质上不同。通过这种方法,SRPO能够更好地处理多智能体之间的协作与竞争关系。

关键设计:在SRPO中,关键参数包括集合的大小和对数比率的计算方式。损失函数设计上,采用了基于集合比率的优化目标,以确保在不同集合大小下的稳定性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SRPO在数学推理和多轮搜索任务中取得了显著的性能提升,尤其是在不同模型规模下,宏平均结果达到了最强水平,展示了其在多智能体优化中的优势。

🎯 应用场景

该研究的潜在应用领域包括复杂任务的自动化处理,如多轮对话系统、协作机器人以及智能搜索引擎等。SRPO方法的有效性和稳定性将推动多智能体系统在实际应用中的广泛采用,提升其在动态环境中的表现。

📄 摘要(原文)

Multi-agent large language models solve complex tasks by coordinating several policies in a shared environment. However, existing reinforcement learning methods usually optimize each response or trajectory separately, even when several outputs jointly cause one state transition. Consequently, the update unit differs from the action executed by the system. To address this problem, we propose SRPO (Setwise Relative Policy Optimization), which treats the active set the minimal set of outputs consumed by one transition, as one multi-agent action. Specifically, SRPO combines member log-ratios into one cardinality-normalized set ratio, assigns one relative advantage, and clips the set once. This formulation unifies division of labor and joint co-evolution as actions with different set sizes. Experiments on mathematical reasoning and multi-turn search demonstrate one training interface for fixed, mixed, and dynamically routed workflows across four model scales, with the strongest macro-average results among the reported comparisons. Optimization diagnostics further characterize its stability under different event reductions and set sizes.