ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning

📄 arXiv: 2606.30072 📥 PDF

作者: Daiki E. Matsunaga, Junho Na, Tri Wahyu Guntara, Scott Sanner, Pascal Poupart, Jongmin Lee, Kee-Eung Kim

分类: cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出ACPO以解决多智能体强化学习中的策略优化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 多智能体强化学习 策略优化 集中训练与分散执行 智能体链式策略优化 合作任务

📋 核心要点

  1. 现有多智能体强化学习方法在策略梯度计算上存在困难,导致无法有效优化共享回报。
  2. 本文提出智能体链式策略优化(ACPO),通过独立训练智能体并将其更新整合为联合策略梯度的单步更新。
  3. 在多机器人仓库、SMACv2和MA-MuJoCo等环境中,ACPO的表现优于多个强基线,且随着智能体数量增加,性能提升显著。

📝 摘要(中文)

在多智能体强化学习(MARL)中,合作任务要求智能体共同最大化共享回报。在集中训练与分散执行(CTDE)框架下,策略梯度的直接计算一直较为困难。现有方法主要有两种:独立因子化更新与集中评论者的组合,缺乏在没有价值分解假设下的联合改进保证;或交替最佳响应更新,可能收敛到次优的纳什均衡。本文展示了联合策略梯度可以精确地分解为每个智能体的独立项,并提出了智能体链式策略优化(ACPO),使得智能体独立训练,其更新共同构成联合策略梯度的单步更新。我们在多个环境中评估了ACPO,结果显示其优于强基线,且随着智能体数量的增加,性能差距进一步扩大。

🔬 方法详解

问题定义:本文旨在解决多智能体强化学习中策略梯度计算的困难,现有方法在联合改进保证和收敛性方面存在不足,导致无法有效优化智能体的合作行为。

核心思路:论文提出的ACPO方法通过对联合策略梯度的精确分解,使得每个智能体的更新可以独立进行,同时又能通过条件化先前动作的信念将这些更新整合为一个联合步骤。

技术框架:ACPO的整体架构包括三个主要模块:独立训练的智能体、基于每个智能体的评分函数的更新机制,以及集中评论者的反馈。智能体在每个时间步依次提交动作,形成一个串行决策过程。

关键创新:ACPO的主要创新在于提出了一种精确的去中心化分解方法,使得每个智能体的更新可以在不依赖于价值分解假设的情况下进行,从而克服了现有方法的局限性。

关键设计:在ACPO中,智能体的更新依赖于每个智能体的评分函数和去中心化评论者的反馈,设计了适当的损失函数以确保更新的有效性,同时采用了适应性学习率来优化训练过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个测试环境中,ACPO显著优于强基线,尤其在多机器人仓库、SMACv2和MA-MuJoCo等任务中,随着智能体数量的增加,性能提升幅度不断扩大,展示了其在复杂场景下的有效性。

🎯 应用场景

该研究的潜在应用领域包括多机器人系统、智能交通管理和分布式控制等场景。通过优化多智能体的合作行为,ACPO能够提升系统的整体效率和响应能力,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Cooperative tasks in Multi-Agent Reinforcement Learning (MARL) require agents to collectively maximize a shared return. Under the Centralized Training with Decentralized Execution (CTDE) paradigm, policy gradients have remained difficult to compute directly. Prior methods largely follow two approaches: independent factorized updates with centralized critics, which lack general joint-improvement guarantees without value decomposition assumptions, or alternating best-response updates, which can converge to suboptimal Nash Equilibria. In this paper, we show the joint policy gradient admits an exact decentralized decomposition of per-agent terms, each formed from per-agent score functions and decentralized critics. Based on this decomposition, we develop Agent-Chained Policy Optimization (ACPO), where actors are trained independently, with their updates together constituting a single step on the joint policy gradient. Central to this result is a serialized view of the simultaneous joint decision in which agents commit actions one at a time, each conditioning on a belief over preceding actions that ties the independent per-agent updates into a single joint step. We evaluate on-policy and off-policy instantiations of ACPO on Multi-Robot Warehouse, SMACv2, and MA-MuJoCo, where it outperforms strong baselines, with the gap widening as the number of agents grows.