EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness
作者: Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li
分类: cs.RO, cs.CV
发布日期: 2026-07-22
💡 一句话要点
提出EA-Nav以解决跨体现导航中的安全性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨体现导航 模仿学习 体现几何 多模态信息 安全导航 机器人导航 自动驾驶
📋 核心要点
- 现有的导航方法在处理不同体现时存在动作模糊性,难以实现安全导航。
- 本文提出了一种模仿学习的体现意识导航框架,通过引入体现几何和多模态信息注入机制来解决这一问题。
- 实验结果显示,所提方法在不同体现设置下显著提升了导航性能,验证了其有效性。
📝 摘要(中文)
跨体现导航是体现智能中的一个关键挑战。由于不同体现之间的差异,相同的视觉观察可能对不同的代理意味着不同的动作,这使得仅依赖视觉的预测变得模糊。现有研究主要依赖强化学习,这需要大规模的交互和精心设计的奖励,难以支持可扩展的预训练和现实世界的适应。相比之下,基于模仿学习的方法仍然有限。为了解决这些挑战,本文提出了一种基于模仿学习的体现意识导航框架,采用模块化的多阶段设计。在预训练阶段,我们从互联网视频中构建了跨体现导航数据集,并引入体现几何作为条件标记,以减少在相同观察下的动作模糊性。在微调阶段,我们设计了一种基于解耦架构的多模态信息注入机制。实验结果表明,所提出的方法有效提高了不同体现设置下的导航性能,证明了将体现几何纳入体现导航的有效性。
🔬 方法详解
问题定义:本文旨在解决跨体现导航中的安全性问题,现有方法在不同体现下的动作模糊性导致导航效果不佳。
核心思路:提出一种基于模仿学习的框架,通过引入体现几何作为条件标记,减少相同观察下的动作模糊性,并通过多模态信息注入机制提升导航安全性。
技术框架:整体架构包括预训练和微调两个阶段。在预训练阶段,构建跨体现导航数据集并引入体现几何;在微调阶段,设计轨迹增强策略生成高风险样本,训练空间感知和风险感知模块。
关键创新:最重要的创新在于引入体现几何作为条件标记,显著减少了动作模糊性,并通过解耦架构实现多模态信息的有效融合。
关键设计:在损失函数设计上,结合了空间感知和风险感知的损失,网络结构采用解耦设计以便于多模态信息的注入,确保了模型在不同体现下的适应性和安全性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的EA-Nav方法在不同体现设置下的导航性能显著提升,相较于基线方法,导航成功率提高了XX%,有效验证了体现几何的引入对安全导航的贡献。
🎯 应用场景
该研究的潜在应用领域包括机器人导航、自动驾驶和虚拟现实等场景。通过提升跨体现导航的安全性和适应性,能够在复杂环境中实现更高效的智能体操作,具有重要的实际价值和未来影响。
📄 摘要(原文)
Cross-embodiment navigation is a key challenge in embodied intelligence. Due to differences in embodiment, the same visual observation may imply different actions for different agents, making prediction ambiguous when relying solely on vision. Existing studies mainly rely on reinforcement learning, which requires large-scale interaction and careful reward design, making it difficult to support scalable pretraining and real-world adaptation. In contrast, imitation-learning-based approaches remain limited. To address these challenges, we propose an imitation-learning-based embodiment-aware navigation framework with a modular multi-stage design. In pretraining, we construct a cross-embodiment navigation dataset from Internet videos and introduce embodiment geometry as conditional tokens to reduce action ambiguity under the same observation. In fine-tuning, we design a multimodal information injection mechanism based on a decoupled architecture. Specifically, we design a trajectory augmentation strategy to generate high-risk samples, which are used to train spatial perception and risk-aware correction separately, thereby explicitly incorporating embodiment geometry for safe navigation. Experimental results show that the proposed method effectively improves navigation performance across different embodiment settings, demonstrating the effectiveness of incorporating embodiment geometry into embodied navigation.