NavArena: Automated Construction of Goal-Oriented Navigation Benchmarks from 3D Gaussian Splatting Reconstructions

📄 arXiv: 2609.04602v1 📥 PDF

作者: Junhui Wang, Wei Yang, Xinyao Li, Ningjing Fan, Yuehao Yin, Xuecheng Chen, Chao Gao

分类: cs.RO

发布日期: 2026-09-04


💡 一句话要点

提出NavArena以解决3D导航基准构建问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction)

关键词: 3D导航 高斯点云 自动化评估 视觉导航 机器人技术 虚拟现实 闭环协议

📋 核心要点

  1. 现有的3D高斯点云重建缺乏导航评估所需的可通行性约束和有效目标,限制了其在实际应用中的有效性。
  2. NavArena通过集成冻结的3D高斯模型和基于高斯统计的占用成本图,自动生成目标导向的导航基准,解决了现有方法的不足。
  3. 在超过2000个场景中,NavArena成功生成了2220万条专家轨迹,展示了其在导航评估中的有效性和可扩展性。

📝 摘要(中文)

固定的3D高斯点云重建虽然能够提供逼真的新视角,但缺乏导航评估所需的可通行性约束、有效目标和闭环协议。本文提出NavArena,一个自动化框架,将固定的3D高斯点云重建转化为目标导向的视觉导航基准。NavArena集成了用于自我中心RGB-D渲染的冻结3D高斯模型、基于高斯密度和高度统计生成的占用成本图,以及从多视角开放词汇掩码中提取的语义目标候选。这些组件支持目标导向导航场景的自动生成和统一闭环评估。在2000多个场景中,NavArena生成了2220万条专家轨迹。空间和语义评估评估了生成的导航表示,而策略回放展示了统一评估协议的诊断价值。NavArena使得在大规模3D高斯重建上进行可扩展和可重复的导航评估成为可能,所有基准生成工具、评估协议和衍生资产将公开发布。

🔬 方法详解

问题定义:现有的固定3D高斯点云重建虽然能够提供逼真的视觉效果,但缺乏必要的可通行性约束和有效目标,导致其在导航评估中的应用受到限制。

核心思路:NavArena通过自动化框架,将固定的3D高斯点云重建转化为目标导向的导航基准,集成了多种技术以支持闭环评估和自动生成导航场景。

技术框架:NavArena的整体架构包括三个主要模块:冻结的3D高斯模型用于RGB-D渲染,占用成本图用于可达性和碰撞查询,以及从多视角掩码中提取的语义目标候选。这些模块协同工作,实现了目标导向导航的自动生成。

关键创新:NavArena的核心创新在于其自动化生成和评估目标导向导航场景的能力,尤其是在大规模3D高斯重建中,显著提高了评估的效率和准确性。

关键设计:在设计中,使用了基于高斯密度和高度统计的占用成本图,确保了导航场景的可通行性,同时采用了开放词汇掩码提取语义目标,增强了目标导向导航的灵活性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

NavArena在超过2000个场景中生成了2220万条专家轨迹,展示了其在目标导向导航评估中的强大能力。通过空间和语义评估,验证了生成的导航表示的有效性,显著提升了评估的准确性和效率。

🎯 应用场景

NavArena的研究成果在机器人导航、虚拟现实和自动驾驶等领域具有广泛的应用潜力。通过提供标准化的导航基准,研究人员和开发者可以更有效地评估和优化导航算法,推动相关技术的进步和应用落地。

📄 摘要(原文)

Fixed 3D Gaussian Splatting (3DGS) reconstructions provide realistic novel views but lack the traversability constraints, valid goals, and closed-loop protocols required for navigation evaluation. We introduce NavArena, an automated framework that transforms fixed 3DGS reconstructions into benchmarks for goal-oriented visual navigation. NavArena integrates a frozen 3DGS model for egocentric RGB-D rendering, an occupancy costmap derived from Gaussian density and height statistics for reachability and collision queries, and semantic goal candidates lifted from multi-view open-vocabulary masks. These components support the automatic generation and unified closed-loop evaluation of goal-oriented navigation episodes. Across more than 2{,}000 scenes, NavArena generates 22.2 million expert trajectories. Spatial and semantic evaluations assess the derived navigation representations, while policy rollouts demonstrate the diagnostic value of the unified evaluation protocol. NavArena enables scalable and reproducible navigation evaluation on large-scale 3DGS reconstructions, and all benchmark-generation tools, evaluation protocols, and derived assets will be released publicly.