Robust Multi-Agent Reinforcement Learning by Mutual Information Regularization
作者: Simin Li, Ruixiao Xu, Jingqiao Xiu, Yuwei Zheng, Pu Feng, Yaodong Yang, Xianglong Liu
分类: cs.LG, cs.AI
发布日期: 2023-10-15 (更新: 2024-05-21)
备注: arXiv admin note: text overlap with arXiv:2310.00339
💡 一句话要点
提出互信息正则化方法以解决多智能体强化学习的鲁棒性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 多智能体强化学习 鲁棒性 互信息正则化 离线策略评估 机器人群体控制
📋 核心要点
- 现有的鲁棒多智能体强化学习方法在处理最坏情况威胁时,计算复杂度高且鲁棒性不足。
- 本文提出将鲁棒MARL视为推理问题,通过互信息正则化(MIR3)在训练中优化鲁棒性,避免了对抗者的需求。
- 实验表明,MIR3在最坏情况对手下显著提升了鲁棒性和训练效率,并在实际应用中表现优异。
📝 摘要(中文)
在多智能体强化学习(MARL)中,确保对盟友不可预测或最坏情况行为的鲁棒性对于实际部署至关重要。现有的鲁棒MARL方法通常需要近似或枚举所有可能的威胁场景,导致计算强度高且鲁棒性降低。本文将鲁棒MARL框架视为推理问题,通过离线策略评估隐式优化最坏情况鲁棒性。我们提出的互信息正则化作为鲁棒正则化(MIR3)在常规训练中能够最大化鲁棒性的下界,无需对抗者。实验结果表明,MIR3在面对最坏情况对手时,显著超越基线方法的鲁棒性和训练效率,同时在《星际争霸II》和机器人群体控制中保持合作性能。实际部署机器人群体控制算法时,我们的方法也比最佳基线提升了14.29%。
🔬 方法详解
问题定义:本文旨在解决多智能体强化学习中的鲁棒性问题,尤其是在面对不可预测的盟友行为时,现有方法往往需要处理大量的威胁场景,导致计算复杂度高且鲁棒性不足。
核心思路:我们将鲁棒MARL框架视为推理问题,通过离线策略评估隐式优化最坏情况鲁棒性。提出的互信息正则化(MIR3)在训练过程中最大化鲁棒性的下界,避免了对抗者的需求。
技术框架:整体架构包括数据收集、离线策略评估和互信息正则化三个主要模块。数据收集阶段获取智能体的行为数据,离线策略评估用于评估不同策略的鲁棒性,MIR3则在训练过程中进行正则化。
关键创新:MIR3作为一种新的鲁棒正则化方法,能够在不需要对抗者的情况下,通过信息瓶颈机制防止智能体对其他智能体的过度反应,从而实现鲁棒性与合作性的平衡。
关键设计:在MIR3中,设计了特定的损失函数以最大化鲁棒性下界,并通过信息瓶颈的方式调整智能体的策略,使其与鲁棒行动先验对齐。
🖼️ 关键图片
📊 实验亮点
在实验中,MIR3在面对最坏情况对手时,显著超越了基线方法,提升了鲁棒性和训练效率。在《星际争霸II》和机器人群体控制的实验中,MIR3的表现优于最佳基线,后者在实际部署中提升了14.29%。
🎯 应用场景
该研究的潜在应用领域包括多智能体系统的协作控制、机器人群体行为优化以及复杂环境中的决策制定。通过提高鲁棒性,该方法能够在实际应用中更好地应对不确定性,提升系统的稳定性和效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
In multi-agent reinforcement learning (MARL), ensuring robustness against unpredictable or worst-case actions by allies is crucial for real-world deployment. Existing robust MARL methods either approximate or enumerate all possible threat scenarios against worst-case adversaries, leading to computational intensity and reduced robustness. In contrast, human learning efficiently acquires robust behaviors in daily life without preparing for every possible threat. Inspired by this, we frame robust MARL as an inference problem, with worst-case robustness implicitly optimized under all threat scenarios via off-policy evaluation. Within this framework, we demonstrate that Mutual Information Regularization as Robust Regularization (MIR3) during routine training is guaranteed to maximize a lower bound on robustness, without the need for adversaries. Further insights show that MIR3 acts as an information bottleneck, preventing agents from over-reacting to others and aligning policies with robust action priors. In the presence of worst-case adversaries, our MIR3 significantly surpasses baseline methods in robustness and training efficiency while maintaining cooperative performance in StarCraft II and robot swarm control. When deploying the robot swarm control algorithm in the real world, our method also outperforms the best baseline by 14.29%.