Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections
作者: Gil Lifshits, Igal Bilik, Gilad Katz
分类: cs.LG, cs.AI, cs.MA, cs.RO
发布日期: 2026-07-23
💡 一句话要点
提出MAPS以解决无信号交叉口自主车辆协调问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自主驾驶 多智能体系统 强化学习 交通协调 深度学习 智能交通 无信号交叉口 原型计划
📋 核心要点
- 现有的多智能体强化学习方法在无信号交叉口的车辆协调中面临组合动作空间和信息依赖等挑战。
- 本文提出的MAPS架构通过主代理生成全局协调策略的紧凑嵌入,解耦战略与战术执行。
- 实验结果表明,MAPS在72种交叉口配置中实现无碰撞导航,且在五代理场景中成功率高达94%。
📝 摘要(中文)
在无信号交叉口协调自主车辆仍然是多智能体强化学习系统面临的重大挑战。现有方法通常在组合动作空间、依赖特权信息或代理设计上存在不足。本文提出了主代理原型计划系统(MAPS),一种分层深度强化学习架构,其中集中式主代理生成紧凑的连续嵌入(原型计划),编码全局协调策略。去中心化的工作代理将该嵌入与本地观察结合,以执行特定于车辆的控制,从而将战略意图与战术执行解耦,允许各模块独立优化。作为该协调机制的概念验证,我们在HighwayEnv中测试了MAPS在72种交叉口配置下的表现,结果显示MAPS实现了无碰撞导航,同时显著减少了平均旅行时间,超越了最先进的基线。学习到的原型计划还表现出强大的泛化能力:在仅用三个代理训练的系统中,零样本部署到五个代理场景时成功率达到94%,验证了基于原型计划的分层学习为多车辆协调提供了有前景的框架。
🔬 方法详解
问题定义:本文旨在解决无信号交叉口自主车辆的协调问题,现有方法在处理组合动作空间和信息依赖方面存在不足,导致协调效率低下。
核心思路:MAPS通过引入主代理生成紧凑的原型计划嵌入,提供全局协调策略,同时让工作代理根据本地观察进行具体控制,从而实现战略与战术的解耦。
技术框架:MAPS架构包含两个主要模块:主代理负责生成原型计划嵌入,工作代理则利用该嵌入与本地信息结合,执行车辆特定的控制策略。
关键创新:MAPS的核心创新在于其分层设计,通过主代理与工作代理的协作,显著提高了多车辆协调的灵活性和效率,区别于传统的集中式或完全去中心化方法。
关键设计:在MAPS中,主代理使用深度强化学习生成原型计划嵌入,工作代理则通过卷积神经网络处理本地观察,优化控制策略,损失函数设计上强调协调性与安全性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MAPS在72种交叉口配置中实现了无碰撞导航,且平均旅行时间显著降低,超越了当前最先进的基线方法。此外,系统在零样本情况下成功率达到94%,展示了其强大的泛化能力和有效性。
🎯 应用场景
该研究的潜在应用领域包括智能交通系统、自动驾驶汽车的交互协调以及城市交通管理。通过提高自主车辆在复杂交叉口的协调能力,MAPS有望显著提升交通安全性和效率,减少交通拥堵,推动智能交通技术的实际应用。未来,MAPS的框架也可以扩展到其他多智能体系统中,具有广泛的应用前景。
📄 摘要(原文)
Coordinating autonomous vehicles at unsignalized intersections remains a critical challenge for multi-agent reinforcement learning (MARL) systems, which typically struggle with combinatorial action spaces, reliance on privileged information, or rigid agent designs. We propose Master-Agent Proto-plan System (MAPS), a hierarchical deep reinforcement learning (DRL) architecture in which a centralized Master agent generates a compact, continuous embedding, denoted as proto-plan, that encodes a global coordination strategy. Decentralized Worker agents integrate this embedding with local observations to execute vehicle-specific control, decoupling strategic intent from tactical execution and enabling independent optimization of each module. As a proof-of-concept evaluation of this coordination mechanism, we test MAPS across 72 intersection configurations in HighwayEnv. MAPS achieves collision-free navigation while significantly reducing average travel time, outperforming state-of-the-art baselines. The learned proto-plans further exhibit robust generalization: a system trained with three agents achieves a 94% success rate when deployed zero-shot to five-agent scenarios, confirming that proto-plan-based hierarchical learning provides a promising framework for multi-vehicle coordination.