DA-Nav: Direction-Aware City-Scale Vision-Language Navigation

📄 arXiv: 2607.11638v1 📥 PDF

作者: Ye Yuan, Kehan Chen, Xinqiang Yu, Wentao Xu, Heng Wang, Libo Huang, Chuanguang Yang, Yan Huang, Jiawei He, Zhulin An

分类: cs.RO

发布日期: 2026-07-13

备注: 9 pages, 8 figures. Submitted to IEEE Robotics and Automation Letters (RA-L)


💡 一句话要点

提出DA-Nav以解决城市规模视觉语言导航问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言导航 方向感知 链式思维推理 轨迹恢复 城市导航 机器人适应性 CARLA环境

📋 核心要点

  1. 现有的城市规模导航方法过于依赖密集地图和昂贵的导航监督,导致灵活性不足。
  2. DA-Nav通过将导航视为离散空间定位问题,利用方向指令和链式思维推理来实现轨迹恢复。
  3. 在CARLA环境中的实验结果显示,DA-Nav的成功率达到56.16%,显著优于现有方法,且无需微调即可适应不同类型的机器人。

📝 摘要(中文)

城市规模的户外导航目前受到对密集地图或昂贵导航监督的高度依赖的限制。本文提出了一种新颖的范式,通过利用商业导航工具(如Google Maps)的方向指令来解决这一问题。为弥合商业指令与可执行导航动作之间的差距,并通过稳健的轨迹恢复来减轻长时间误差积累,提出了DA-Nav,一个方向感知的视觉语言导航框架。DA-Nav将导航重新定义为在自我中心的二维图像平面上的离散空间定位问题。为实现轨迹恢复,DA-Nav采用了链式思维(CoT)推理过程,包括偏差评估、动作预测和目标网格选择。此外,本文还引入了ReDA数据集,提供方向感知指令和恢复轨迹,以增强空间定位并支持CoT恢复推理。在CARLA环境中的广泛实验表明,DA-Nav在未见过的城市环境中取得了56.16%的高成功率,超越了现有的最先进方法,同时保持了更强的恢复能力。

🔬 方法详解

问题定义:本文旨在解决城市规模户外导航中对密集地图和昂贵导航监督的依赖问题。现有方法在长时间导航中容易出现误差积累,导致导航效果不佳。

核心思路:DA-Nav的核心思路是将导航任务重新定义为在自我中心的二维图像平面上的离散空间定位问题,通过利用商业导航工具的方向指令来指导导航。采用链式思维推理过程来实现轨迹恢复,增强导航的准确性和鲁棒性。

技术框架:DA-Nav的整体架构包括三个主要模块:偏差评估、动作预测和目标网格选择。通过这些模块的协同工作,DA-Nav能够有效地处理导航中的各种挑战。

关键创新:DA-Nav的主要创新在于其将导航视为离散空间定位问题的重新定义,以及引入链式思维推理过程来实现轨迹恢复。这一方法与传统依赖于密集地图的导航方法本质上不同,提供了更高的灵活性和适应性。

关键设计:在设计中,DA-Nav采用了特定的损失函数来优化轨迹恢复过程,并通过调整网络结构来增强模型对方向指令的理解能力。具体参数设置和网络结构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DA-Nav在CARLA环境中的实验结果显示,其在未见过的城市环境中的成功率达到56.16%,显著高于现有最先进方法。同时,DA-Nav在不同类型的机器人上无需微调即可实现稳定的公里级闭环户外导航,展现出强大的适应性和恢复能力。

🎯 应用场景

DA-Nav的研究成果具有广泛的应用潜力,尤其是在智能机器人、自动驾驶和增强现实等领域。其方向感知的导航能力能够提升机器人在复杂城市环境中的自主导航能力,未来可能推动智能交通系统和智能城市的发展。

📄 摘要(原文)

City-scale outdoor navigation is currently hindered by the heavy reliance on dense maps or costly navigation supervision. In this work, we introduce a novel paradigm for leveraging directional instructions from commercial navigation tools (e.g., Google Maps). To bridge the gap between commercial instructions and executable navigation actions, while mitigating long-horizon error accumulation through robust trajectory recovery, we propose DA-Nav, a Direction-Aware vision-language Navigation framework that reformulates navigation as a discrete spatial grounding problem on the egocentric 2D image plane. To achieve trajectory recovery, DA-Nav employs a Chain-of-Thought (CoT) reasoning process encompassing deviation assessment, action prediction, and target grid selection. We further introduce ReDA, a dataset that provides direction-aware instructions and recovery trajectories to enhance spatial grounding and support CoT recovery reasoning. Extensive experiments in CARLA demonstrate that DA-Nav achieves a high success rate of 56.16% in unseen urban environments, outperforming existing State-of-The-Art (SoTA) methods while maintaining a substantially stronger recovery capability. Furthermore, without fine-tuning, DA-Nav seamlessly adapts to both quadruped and humanoid robots, enabling stable kilometer-scale closed-loop outdoor navigation in complex real world environments.