Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning

📄 arXiv: 2607.19809v1 📥 PDF

作者: Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi

分类: cs.MA, cs.LG

发布日期: 2026-07-22

备注: 15 pages, 6 figures. Under review at ICONIP 2026


💡 一句话要点

提出Dreamer-CPC以解决多智能体强化学习中的信息共享问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 多智能体强化学习 信息共享 集体预测编码 世界模型 去中心化学习 机器人协作 决策支持

📋 核心要点

  1. 现有的多智能体强化学习方法在部分可观测环境下,智能体间的通信能力不足,无法有效传递历史信息。
  2. 本文提出的Dreamer-CPC方法通过集成基于CPC的消息学习,利用智能体的世界模型来推断和交换消息,克服了当前观察的局限性。
  3. 实验结果表明,Dreamer-CPC在Observer和CatchApple环境中均优于现有的基线方法,特别是在CatchApple中,其表现提升了4到5倍。

📝 摘要(中文)

在多智能体强化学习(MARL)中,智能体间的通信对于在部分可观测环境下提升性能至关重要。基于表示学习的方法使得去中心化的智能体能够学习基于自身观察的消息,但仅依赖当前观察,无法传递积累的信息。本文提出了Dreamer-CPC,这是一种去中心化的基于模型的MARL方法,将基于集体预测编码(CPC)的消息学习集成到DreamerV3的世界模型中。每个智能体独立维护一个世界模型和消息模块,从反映过去观察和行动历史的潜在状态中推断和交换消息。在两个环境中评估了Dreamer-CPC,结果显示其在信息共享任务和新引入的任务中均优于现有方法,尤其在CatchApple任务中,表现出显著的协调能力。

🔬 方法详解

问题定义:本文旨在解决多智能体强化学习中,智能体在部分可观测环境下无法有效共享历史信息的问题。现有方法主要依赖当前观察,导致信息传递不足,影响决策质量。

核心思路:Dreamer-CPC通过将集体预测编码(CPC)与DreamerV3的世界模型相结合,使每个智能体能够独立维护世界模型和消息模块,从潜在状态中推断和交换消息,进而实现信息的有效共享。

技术框架:该方法的整体架构包括两个主要模块:世界模型模块和消息模块。智能体通过世界模型生成潜在状态,并利用这些状态推断消息,随后进行消息的交换与更新。

关键创新:Dreamer-CPC的最大创新在于其将历史信息的传递与潜在动态结合,允许智能体在缺乏当前观察的情况下仍能进行有效的决策。这一设计与传统方法形成鲜明对比,后者仅依赖于当前观察。

关键设计:在技术细节上,Dreamer-CPC采用了特定的损失函数来优化消息的生成与交换,同时在网络结构上,确保了世界模型和消息模块的高效协同工作。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Dreamer-CPC在Observer和CatchApple环境中均显著优于IPPO-CPC等基线方法。在CatchApple任务中,Dreamer-CPC的回报提升了4到5倍,展现了其在缺失观察情况下的有效协调能力。

🎯 应用场景

该研究的潜在应用领域包括机器人协作、智能交通系统和多智能体游戏等场景。在这些领域中,智能体需要在部分可观测环境下进行有效的协作与决策,Dreamer-CPC提供了一种新的思路来提升智能体间的信息共享能力,具有重要的实际价值和未来影响。

📄 摘要(原文)

In multi-agent reinforcement learning (MARL), inter-agent communication is effective for improving performance under partial observability. Representation learning-based approaches enable decentralized agents to learn messages grounded in their own observations, but they rely only on current observations and cannot convey information accumulated over time. We propose Dreamer-CPC, a decentralized model-based MARL method that integrates message learning based on Collective Predictive Coding (CPC) into the world model of DreamerV3. Each agent independently maintains a world model and a message module, and infers and exchanges messages from the latent states of the world model that reflect the history of past observations and actions. We evaluated Dreamer-CPC in two environments: Observer, a non-cooperative information-sharing task, and CatchApple, a newly introduced task in which task-relevant observations are temporarily missing. In both environments, Dreamer-CPC outperformed IPPO-CPC, an existing CPC-based method that generates messages from current observations, as well as no-communication baselines. In particular, in CatchApple, Dreamer-CPC achieved 4 to 5 times the episode return of IPPO-CPC, demonstrating effective coordination where other methods fail due to missing observations. These results suggest that communication grounded in the latent dynamics of world models can support decentralized decision-making when current observations alone are insufficient.