Instance-Enriched Semantic Maps for Visual Language Navigation

📄 arXiv: 2607.12630 📥 PDF

作者: Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

分类: cs.RO, cs.CV

发布日期: 2026-07-20


💡 一句话要点

提出实例丰富的语义地图以解决视觉语言导航中的对象细节不足问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言导航 实例丰富语义地图 大型语言模型 2.5D信息映射 查询处理 智能代理 室内导航

📋 核心要点

  1. 现有视觉语言导航方法在对象细节和对多样化查询的鲁棒性方面存在不足,限制了复杂室内环境中的导航能力。
  2. 本文提出实例丰富的语义地图,通过实例级2.5D信息映射和LLM驱动的查询处理来提升导航的可靠性和灵活性。
  3. 实验结果显示,所提方法在对象检索上提升超过17%,导航成功率提升超过23%,显著优于基线方法。

📝 摘要(中文)

视觉语言导航(VLN)旨在使具身代理能够通过自然语言指令在复杂环境中导航。尽管现有方法在构建语义空间地图和利用大型语言模型(LLMs)进行推理与决策方面取得了一定进展,但仍缺乏实例级对象细节和对多样化用户查询的鲁棒性,限制了在复杂室内环境中的可靠导航。为了解决这些问题,本文提出了实例丰富的语义地图框架,包含三大核心贡献:1)通过开放词汇全景分割构建实例级2.5D丰富信息地图,保留垂直区分并捕捉小物体,同时存储多样的语义属性和自然语言描述;2)基于LLM的目标选择实现鲁棒的查询处理,动态路由查询并通过得分级融合整合输出;3)存储高效的语义表示,相较于三维场景图方法减少约96%的存储需求,同时保留足够的空间信息。实验结果表明,该方法在对象检索和导航成功率上均有显著提升。

🔬 方法详解

问题定义:本文旨在解决现有视觉语言导航系统在复杂室内环境中缺乏实例级对象细节和对多样化用户查询的鲁棒性的问题。现有方法往往无法有效处理细小物体和复杂的语义信息,导致导航性能受限。

核心思路:提出实例丰富的语义地图,通过构建2.5D丰富信息地图和利用大型语言模型(LLM)进行动态查询处理,以增强导航系统的细节捕捉能力和查询响应能力。这样的设计使得系统能够更好地理解和执行复杂的自然语言指令。

技术框架:整体架构包括三个主要模块:1)实例级2.5D信息映射模块,负责从颜色和深度观测中构建地图;2)基于LLM的查询处理模块,动态路由用户查询并整合不同专家的输出;3)高效的语义表示模块,优化存储和信息提取。

关键创新:最重要的创新在于引入实例级2.5D丰富信息映射,能够保留垂直区分和小物体信息,同时通过开放词汇全景分割实现多样的语义属性存储。这与传统的3D场景图方法有本质区别,后者往往无法有效处理细节信息。

关键设计:在技术细节上,采用开放词汇全景分割技术进行实例级信息提取,并设计了基于得分级融合的查询处理机制,以提高查询的准确性和响应速度。此外,语义表示的存储结构经过优化,显著减少了存储需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的方法在对象检索任务中提升超过17%,在导航成功率上提升超过23%,相较于基线方法表现出显著的性能改进。此外,所提方法的存储需求较三维场景图方法减少约96%,在保持空间信息的同时实现了高效的语义表示。

🎯 应用场景

该研究的潜在应用领域包括智能家居、机器人导航和增强现实等场景。通过提升视觉语言导航的鲁棒性和准确性,能够为用户提供更为自然和直观的交互体验,推动智能代理在复杂环境中的应用。未来,该技术有望在更多实际场景中得到广泛应用,提升人机交互的效率和便利性。

📄 摘要(原文)

Visual Language Navigation (VLN) aims to enable an embodied agent to navigate complex environments by following natural language instructions. Recent approaches build semantic spatial maps and leverage Large Language Models (LLMs) for reasoning and decision making. Despite these advances, existing systems lack instance-level object detail and robustness to diverse user queries, limiting reliable navigation in complex indoor environments. To address these limitations, we propose Instance-Enriched Semantic Maps, a unified framework with three key contributions: (1) Instance-level two-and-a-half-dimensional (2.5D) rich information mapping that constructs maps from color and depth observations via open-vocabulary panoptic segmentation, preserving vertical distinctions and capturing small objects, while storing diverse semantic attributes and natural language captions enriched with room-level context. (2) Robust query processing via LLM-based target selection, which dynamically routes queries across type-specialized experts and integrates their outputs through score-level fusion, enabling consistent goal selection across diverse query formulations. (3) Storage-efficient semantic representation that achieves approximately 96% reduction compared to three-dimensional (3D) scene-graph approaches while preserving sufficient spatial information for navigation. The proposed 2.5D representation outperforms the 3D baseline by over 27% in prediction-normalized Area Under the Curve (AUC). In navigation experiments, our method achieves over 17% improvement in object retrieval and over 23% in navigation success compared to the baseline across diverse query types. The project page is available atthis https URL.