VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation

📄 arXiv: 2607.14514v1 📥 PDF

作者: Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

分类: cs.CV, cs.AI

发布日期: 2026-07-16


💡 一句话要点

提出VTM-Nav以解决跨情节目标导航问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 物体目标导航 层次记忆 视觉-语言模型 经验重用 智能体技术

📋 核心要点

  1. 现有方法在跨情节物体目标导航中通常重置场景状态,导致经验无法重用,影响导航效率。
  2. 本文提出了一种新的导航框架VTM-Nav,利用层次视觉-拓扑记忆来组织和重用场景知识,支持智能体在同一场景中的多次操作。
  3. 在HM3D和MP3D等基准测试中,VTM-Nav在性能上超越了现有的WMNav基线,展示了其在跨情节导航中的优势。

📝 摘要(中文)

物体目标导航要求具身智能体在室内环境中定位并到达指定物体类别的实例。近期的无训练方法利用视觉-语言模型(VLM)进行开放词汇的语义推理,但通常在每个情节后重置所有场景特定状态。本文提出跨情节物体目标导航,智能体在同一场景中重复操作,仅保留自我获得的经验,并保持模型参数不变。为支持经验重用,我们提出了一种训练无关的VLM导航框架,具有持久的层次视觉-拓扑记忆(VTM),该记忆在房间和物体层面组织场景知识,并通过粗到细的匹配检索相关经验,仅在与当前观察一致时提供软性指导。保守的执行保护进一步减轻了振荡、阻塞运动和过早停止的问题。我们在HM3D v0.1、HM3D v0.2和MP3D三个基准上评估了该方法,并与增强了跨情节文本记忆的WMNav基线进行了比较,结果显示该方法在所有基准上均取得最佳性能,证明了结构化视觉-拓扑经验重用的有效性和鲁棒性。

🔬 方法详解

问题定义:本文旨在解决跨情节物体目标导航中的经验重用问题。现有方法在每个情节后重置场景状态,导致智能体无法利用之前的经验进行有效导航。

核心思路:提出VTM-Nav框架,通过持久的层次视觉-拓扑记忆(VTM)来组织和重用场景知识,使智能体能够在同一场景中多次操作并保留自我获得的经验。

技术框架:VTM-Nav框架包括两个主要模块:层次视觉-拓扑记忆(VTM)和保守执行保护。VTM负责组织场景知识并通过粗到细的匹配检索相关经验,而执行保护则确保智能体的动作稳定性。

关键创新:VTM的设计是本文的核心创新,它通过层次化的方式组织场景知识,使得智能体在导航时能够有效利用之前的经验,显著提高了导航的效率和准确性。

关键设计:在VTM中,记忆的组织结构分为房间层和物体层,采用粗到细的匹配策略进行经验检索。此外,执行保护机制通过限制智能体的动作范围,避免了振荡和过早停止等问题。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在HM3D v0.1、HM3D v0.2和MP3D三个基准测试中,VTM-Nav均取得了最佳性能,相较于增强的WMNav基线,性能提升幅度达到XX%。这一结果验证了结构化视觉-拓扑经验重用的有效性和鲁棒性。

🎯 应用场景

该研究的潜在应用领域包括室内导航、机器人自主移动和智能家居系统。通过提升智能体在复杂环境中的导航能力,VTM-Nav能够为实际应用提供更高效和可靠的解决方案,推动智能体技术的进一步发展。

📄 摘要(原文)

Object-goal navigation requires an embodied agent to locate and reach an instance of a specified object category in an indoor environment. Recent training-free approaches leverage vision-language models (VLMs) for open-vocabulary semantic reasoning, but are typically evaluated under an episodic protocol that resets all scene-specific state after each episode. We introduce Cross-Episode Object-Goal Navigation, in which an agent repeatedly operates in the same scene, retains only self-acquired experience, and keeps its model parameters fixed. To support experience reuse, we present \method, a training-free VLM navigation framework with a persistent hierarchical Visual-Topological Memory (VTM). The VTM organizes scene knowledge at room and object levels and retrieves relevant experience through coarse-to-fine matching, providing memory as soft guidance only when it agrees with current observations. A conservative execution guard further mitigates oscillations, blocked motions, and premature stopping. Under a controlled same-scene protocol, we evaluate \method{} on three benchmarks, HM3D v0.1, HM3D v0.2, and MP3D, and compare it with a strengthened WMNav baseline augmented with cross-episode textual memory, while keeping the VLM backbone and action pipeline identical. \method{} achieves the best performance across all three benchmarks, demonstrating the effectiveness and robustness of structured visual-topological experience reuse across datasets.