Learning Adaptive Safety Margins for Visual Navigation

📄 arXiv: 2607.18200v1 📥 PDF

作者: Junyi Hu, Shuaihang Yuan, Geeta Chandra Raju Bethala, Anthony Tzes, Yi Fang

分类: cs.RO, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出自适应安全边际学习方法以解决机器人视觉导航问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱六:视频提取与匹配 (Video Extraction)

关键词: 自适应安全边际 视觉导航 机器人路径规划 扩散规划 上下文条件评估

📋 核心要点

  1. 现有的固定安全边际设置常常导致机器人在复杂环境中导航失败,无法有效平衡安全与效率。
  2. 本文提出了一种上下文条件的安全评估器,通过学习自适应的清晰度偏好来优化轨迹选择,包含多个互补的评估指标。
  3. 在多个数据集上进行的实验表明,该方法在成功率和路径长度加权成功率上均优于现有的扩散、优化和强化学习基线。

📝 摘要(中文)

在拥挤的室内环境中,机器人常常由于固定的安全边际设置不当而失败。过于保守的边际会导致绕行和超时,而过于宽松的边际则可能在感知偏差下导致接近边界的快捷路径。本文提出了一种上下文条件的安全评估器,学习自适应的清晰度偏好,以对扩散规划生成的轨迹候选进行排名。该方法在HM3D和MP3D的PointGoal导航任务中表现出色,成功率和路径长度加权成功率均超过了多种强基线,且在没有任务特定调优的情况下成功转移到Unitree G1人形机器人上。

🔬 方法详解

问题定义:本文旨在解决机器人在复杂室内环境中由于固定安全边际设置不当而导致的导航失败问题。现有方法在安全与效率之间的平衡存在明显不足,导致机器人无法有效选择合适的路径。

核心思路:论文提出的上下文条件安全评估器通过学习自适应的清晰度偏好来对扩散规划生成的轨迹候选进行排名。该评估器综合考虑安全性、效率和距离约束,以实现更优的路径选择。

技术框架:整体架构包括三个主要模块:安全性评估模块、效率评估模块和距离约束匹配模块。安全性评估模块通过清晰度预算惩罚和控制障碍函数残差来评估路径的安全性;效率评估模块结合平滑性惩罚和安全门控绕行比惩罚来避免不必要的绕行;距离约束匹配模块确保学习的预算与实际的扩展距离场清晰度相匹配。

关键创新:最重要的创新点在于提出了上下文条件的安全评估器,该评估器能够动态调整安全边际,避免了传统方法中固定边际导致的效率损失和安全隐患。

关键设计:在训练过程中,使用特权的扩展距离场几何信息进行模拟训练,并通过两阶段的教师-学生程序将其蒸馏为仅依赖感知的选择器。损失函数设计上,结合了多个惩罚项以平衡安全性与效率,确保路径选择的可靠性与实用性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在HM3D和MP3D数据集上的成功率和路径长度加权成功率均达到了最高水平,超越了多种强基线方法。特别是在没有任务特定调优的情况下,成功转移到Unitree G1人形机器人,展示了良好的通用性和适应性。

🎯 应用场景

该研究的潜在应用领域包括自主导航机器人、智能家居系统和无人机等。通过优化机器人在复杂环境中的导航能力,可以显著提升其在实际应用中的安全性和效率,推动智能机器人技术的进一步发展。

📄 摘要(原文)

Robots in cluttered indoor spaces often fail not because they cannot generate collision-free paths, but because a fixed safety margin is mis-calibrated: conservative margins cause detours and timeouts, while permissive margins lead to near-boundary shortcuts under perception bias. Diffusion-based planners propose diverse trajectory candidates from egocentric RGB-D, yet reliable selection remains the bottleneck. We propose a context-conditioned safety critic that learns an adaptive clearance preference for ranking diffusion proposals, decomposed into three complementary terms: (i) a safety term with a clearance-budget penalty and a control-barrier-function residual for waypoint- and transition-wise safety, (ii) an efficiency term combining a smoothness penalty with a safety-gated detour-ratio penalty that avoids detours without incentivizing risky shortcuts, and (iii) a distance-constraint matching term that anchors the learned budget to realized ESDF clearances to prevent margin collapse. We train the critic with privileged ESDF geometry in simulation and distill it into a perception-only selector via a two-stage teacher-student procedure. On PointGoal navigation in HM3D and MP3D, including cross-dataset transfer, our method achieves the highest success rate (SR) and success weighted by path length (SPL) among strong diffusion, optimization, and RL baselines. Trained purely in simulation, it transfers to a Unitree G1 humanoid and navigates cluttered indoor scenes without task-specific tuning.