COLMAR: Cooperative View Policy Learning for Multi-Agent Active 3D Reconstruction
作者: Phu Pham, Damon Conover, Aniket Bera
分类: cs.RO
发布日期: 2026-07-15
备注: 8 pages, 5 figures, IROS 2026
💡 一句话要点
提出COLMAR以解决多智能体主动3D重建中的视角选择问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 主动3D重建 多智能体系统 视角选择 合作学习 深度学习 机器人技术 增量重建 空间感知
📋 核心要点
- 现有的多智能体主动3D重建方法在视角选择上存在冗余观察和空间聚集等协调效率低下的问题,影响重建质量。
- COLMAR框架通过共享策略优化和重建感知目标,优化视角分配,促进团队合作和安全探索,提升重建效果。
- 实验结果显示,COLMAR在多个数据集上相较于传统方法有显著提升,重建精度和覆盖率分别提高了54%和49%。
📝 摘要(中文)
主动3D重建需要在有限的感知预算下选择信息丰富的视角。在多智能体环境中,协调效率低下(如冗余观察和空间聚集)会显著降低重建质量。本文提出COLMAR,一个用于多智能体主动3D重建的合作视角策略学习框架。COLMAR将视角分配公式化为基于地图的共享策略优化,并引入重建感知目标,促进重叠覆盖、团队级发现和安全探索。通过增量重建更新获得的密集反馈,使探索行为与下游几何质量对齐。该策略使用参数共享的近端策略优化(PPO)进行训练,在部署时采用独立的每智能体动作选择,基于融合的团队地图,并且不进行智能体间的消息传递。选定的视角随后通过3D高斯点云重建(3DGS)进行高保真光度评估。实验结果表明,COLMAR在GLEAM和Replica数据集上相较于启发式和非合作基线有显著提升,重建精度提高了54%,覆盖率提升了49%。
🔬 方法详解
问题定义:本文旨在解决多智能体主动3D重建中视角选择的协调效率低下问题,现有方法常常导致冗余观察和空间聚集,影响重建质量。
核心思路:COLMAR框架通过将视角分配视为基于地图的共享策略优化,结合重建感知目标,促进智能体之间的协作,提升重建效果。
技术框架:COLMAR的整体架构包括视角选择模块、重建感知目标模块和增量反馈模块。视角选择模块负责根据团队地图选择最佳视角,重建感知目标模块则确保覆盖和探索的有效性。
关键创新:COLMAR的主要创新在于引入重建感知目标,促进团队级的发现和安全探索,同时采用参数共享的PPO进行策略训练,避免了智能体间的消息传递。
关键设计:在设计中,COLMAR使用了参数共享的PPO算法,确保每个智能体在部署时能够独立选择动作,且基于融合的团队地图进行决策,损失函数设计上注重重建质量与覆盖率的平衡。
🖼️ 关键图片
📊 实验亮点
实验结果表明,COLMAR在GLEAM和Replica数据集上相较于启发式和非合作基线,重建精度提高了54%,覆盖率提升了49%。这些结果显示了COLMAR在多智能体主动3D重建中的有效性和优势。
🎯 应用场景
COLMAR框架在多智能体系统中具有广泛的应用潜力,特别是在机器人协作、无人机群体探测和自动驾驶等领域。通过优化视角选择和提升重建质量,COLMAR能够在复杂环境中实现更高效的空间感知和环境建模,具有重要的实际价值和未来影响。
📄 摘要(原文)
Active 3D reconstruction requires selecting informative viewpoints under limited sensing budgets. In multi-agent settings, coordination inefficiencies such as redundant observations and spatial clustering can significantly reduce reconstruction quality. We present COLMAR, a cooperative view policy learning framework for multi-agent active 3D reconstruction. COLMAR formulates viewpoint allocation as a shared policy optimization over map-centric observations and introduces a reconstruction-aware objective that promotes overlap-aware coverage, team-level discovery, and collision-safe exploration. Dense feedback derived from incremental reconstruction updates aligns exploration behavior with downstream geometric quality. The policy is trained using parameter-sharing Proximal Policy Optimization (PPO) with independent per-agent action selection at deployment, conditioned on a fused team map and without inter-agent message passing for decision making. Selected viewpoints are then reconstructed with 3D Gaussian Splatting (3DGS) for high-fidelity photometric evaluation. Experiments on GLEAM and Replica demonstrate consistent improvements over heuristic and non-cooperative baselines, achieving up to 54% higher reconstruction accuracy and 49% greater coverage under matched sensing budgets.