Delay-Aware Active Triangulation with Uncertainty-Driven Multi-Agent Reinforcement Learning for Counter-UAS
作者: Seungwook Lee, David Hyunchul Shim
分类: cs.RO, cs.MA
发布日期: 2026-07-07
备注: Accepted to IROS 2026
💡 一句话要点
提出延迟感知主动三角测量以解决反无人机定位问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 反无人机 多智能体系统 强化学习 三角测量 延迟感知 不确定性驱动 目标定位
📋 核心要点
- 现有的多智能体视觉三角测量方法未考虑检测、通信和决策中的延迟,导致定位精度下降。
- 本文提出了一种延迟感知的多智能体强化学习框架,利用信息时效性增强观察以实现更有效的目标定位。
- 实验结果显示,所提方法在三角测量有效性和均方根误差上均优于传统方法,验证了其有效性和鲁棒性。
📝 摘要(中文)
多智能体主动视觉三角测量通过协调可控摄像头的移动观察者,实现对空中目标的精确三维定位。然而,现有方法假设状态反馈是瞬时的,忽略了检测、通信和决策传播中的累积延迟。本文提出了一种延迟感知、基于不确定性的多智能体强化学习框架,应用于反无人机定位。我们的贡献包括:1)通过信息时效性(AoI)增强观察的Dec-POMDP模型,提升三角测量有效性10.6个百分点;2)对比实验表明,感知一致性奖励优于特权清晰状态奖励(0.547米对0.633米均方根误差,减少27%跟踪丢失);3)多源分析协方差传播,综合考虑像素、姿态、云台和内参的不确定性,限制于角度噪声会导致2.8倍的均方根误差退化。使用MAPPO在4096个并行环境中进行实验,达到了0.547±0.217米的均方根误差和78.1%的三角测量有效性,而MLP策略的有效性接近零(0.7%),确认了递归记忆在延迟补偿中的重要性。
🔬 方法详解
问题定义:本文旨在解决现有多智能体视觉三角测量方法在反无人机定位中因延迟而导致的精度不足问题。现有方法假设状态反馈是瞬时的,未能考虑检测、通信和决策过程中的累积延迟。
核心思路:论文提出了一种基于延迟感知和不确定性的多智能体强化学习框架,通过引入信息时效性(AoI)来增强观察,改善三角测量的有效性和稳定性。
技术框架:整体架构包括三个主要模块:1)Dec-POMDP模型,利用AoI增强观察;2)基于感知一致性的奖励机制;3)多源协方差传播,综合考虑不同来源的不确定性。
关键创新:最重要的技术创新在于将信息时效性引入到多智能体强化学习中,显著提升了三角测量的有效性,并在延迟补偿方面表现出色。与传统方法相比,本文方法在处理延迟时表现出更高的鲁棒性。
关键设计:在设计中,采用了感知一致性奖励而非特权清晰状态奖励,优化了策略的稳定性和鲁棒性。此外,采用了多源协方差传播方法,确保了对不同不确定性的全面考虑。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用MAPPO算法在4096个并行环境中,所提方法达到了0.547±0.217米的均方根误差和78.1%的三角测量有效性,相较于传统方法显著提升了27%的跟踪稳定性,验证了感知一致性奖励的有效性。
🎯 应用场景
该研究在反无人机系统中具有重要的应用潜力,能够提升无人机目标定位的精度和可靠性,尤其是在复杂环境中。未来,随着技术的进步,该方法还可以扩展到其他需要高精度定位的领域,如自动驾驶、机器人导航等。
📄 摘要(原文)
Multi-agent active visual triangulation enables precise 3D localization of aerial targets by coordinating mobile observers with controllable cameras. However, existing methods assume instantaneous state feedback, ignoring cumulative latency from detection, communication, and decision propagation. We present a delay-aware, uncertainty-driven multi-agent reinforcement learning framework for target localization in Counter-UAS applications. Our contributions are: (1) a Dec-POMDP formulation with Age-of-Information (AoI) augmented observations enabling delay-aware coordination -- AoI improves triangulation validity by 10.6 percentage points; (2) a controlled comparison showing that perception-consistent rewards outperform privileged clean-state rewards (0.547 m vs.0.633 m RMSE, 27% fewer track losses) -- both policies are trained through identical observation noise but differ in what they are optimized for, producing a stability-robustness tradeoff; and (3) multi-source analytical covariance propagation incorporating pixel, pose, gimbal, and intrinsics uncertainties -- restricting to angular noise alone causes 2.8-fold RMSE degradation. Experiments with MAPPO in 4096 parallel environments achieve 0.547 +- 0.217 m RMSE with 78.1% triangulation validity, while MLP policies achieve near-zero validity (0.7%), confirming recurrent memory as essential for delay compensation.