NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation
作者: Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari
分类: cs.RO, cs.CV
发布日期: 2026-07-22
💡 一句话要点
提出NavVerse以解决室内到室外机器人导航问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 室内导航 室外导航 机器人导航 物理启用 基准评估 跨上下文适应性 视觉-语言导航
📋 核心要点
- 现有方法通常将室内和室外导航分开评估,忽略了机器人执行过程中的边界穿越和适应性等问题。
- NavVerse通过引入物理启用的基准,整合了室内和室外场景,提供了全面的导航评估框架。
- 实验结果显示,现有代理在跨上下文导航中表现不佳,尤其在室外到室内场景的适应性上存在明显下降。
📝 摘要(中文)
在交付、校园和应急响应等场景中,机器人常需在单一连续的任务中从室内导航到室外。现有基准通常将室内和室外导航分开评估,且忽略了机器人执行过程中的诸多挑战。为此,本文提出了NavVerse,一个物理启用的室内到室外导航基准,包含100个室内场景、50个城市室外场景和50个室内到室外场景,涵盖了对象导航、视觉-语言导航和地点导航任务。通过可执行的机器人接口,评估任务成功率、路径效率和安全性。零样本实验表明,现有代理在跨上下文导航方面仍有很大差距,尤其在室外到室内场景的适应性上存在明显瓶颈。
🔬 方法详解
问题定义:本文旨在解决机器人在室内到室外导航中的适应性和执行效率问题。现有方法往往将室内和室外导航分开评估,导致对边界穿越和适应性挑战的忽视。
核心思路:NavVerse的核心思想是创建一个物理启用的基准,整合室内和室外场景,以便全面评估机器人在不同环境下的导航能力。通过提供多样化的场景和任务,促进对跨上下文导航的研究。
技术框架:NavVerse包含100个室内场景、50个城市室外场景和50个室内到室外场景,涵盖对象导航、视觉-语言导航和地点导航任务。评估通过可执行的机器人接口进行,使用任务成功率、路径效率和安全性等指标。
关键创新:NavVerse的主要创新在于其物理启用的设计,允许机器人在真实环境中进行导航评估,填补了现有基准在执行过程中的空白。与传统方法相比,NavVerse提供了更为真实的导航挑战。
关键设计:在设计中,NavVerse采用了多种场景组合和任务类型,确保评估的全面性。同时,使用了适应性强的评估指标,以便更好地反映机器人在复杂环境中的表现。
🖼️ 关键图片
📊 实验亮点
实验结果显示,现有代理在零样本实验中的成功率仍然较低,尤其在室外到室内场景的适应性上表现不佳。尽管端到端的视觉-语言代理取得了最高的零样本成功率,但模块化方法在安全性方面表现最佳,显示出不同方法在不同指标上的优势和局限。
🎯 应用场景
NavVerse的研究成果在多个领域具有潜在应用价值,包括自动配送、智能校园管理和紧急响应系统等。通过提升机器人在复杂环境中的导航能力,能够有效提高服务效率和安全性,推动智能机器人技术的进一步发展。
📄 摘要(原文)
Robots deployed in delivery, campus, and emergency-response settings often need to navigate from buildings to streets within a single continuous episode. Existing benchmarks usually evaluate indoor and outdoor navigation separately, and many abstract away robot execution, leaving exit finding, boundary traversal, adaptation, and kinodynamic failures underexplored. We introduce NavVerse, a physics-enabled benchmark for indoor-to-outdoor embodied navigation. NavVerse contains 100 indoor scenes, 50 urban outdoor scenes, and 50 indoor-to-outdoor scenes, and 10,000 episodes spanning Object Navigation, Vision-and-Language Navigation, and Place Navigation tasks, where agents search for semantic points of interest such as restaurants or banks. Agents are evaluated through executable robot interfaces using task-success, path-efficiency, and safety metrics. Zero-shot experiments with RL, VLA, and modular baselines show that current agents remain far from solving cross-context navigation: end-to-end VLAs obtain the highest zero-shot success, while the modular method provides the strongest safety profile. PlaceNav further reveals a clear drop from outdoor to indoor-to-outdoor scenes, indicating that adaptation remains major bottleneck.