Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

📄 arXiv: 2607.11529v1 📥 PDF

作者: Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang

分类: cs.CV

发布日期: 2026-07-13

备注: 10 pages, 4 figures. Accepted to CVPR 2026

期刊: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 23859-23868

🔗 代码/项目: GITHUB


💡 一句话要点

提出PSC-AVDN框架以解决高空无人机导航中的训练依赖问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 无人机导航 视觉对话 结构化空间记忆 无训练框架 推理流程 多模态融合 高空观察

📋 核心要点

  1. 现有的高空无人机导航方法在方向定位和空间记忆方面存在不足,导致导航的可靠性较低。
  2. 论文提出的PSC-AVDN框架通过解析、搜索和确认三个阶段的推理流程,结合结构化空间记忆,解决了导航中的模糊性问题。
  3. 在ANDH和ANDH-Full数据集上的实验表明,PSC-AVDN在无训练设置下达到了新的最优性能,超越了多种微调方法。

📝 摘要(中文)

本文针对高空无人机导航中的Aerial Vision-and-Dialog Navigation (AVDN)任务,提出了一种无训练的框架PSC-AVDN,以提高资源效率。现有方法在方向定位和空间记忆方面存在不足,导致导航不可靠。为了解决这些问题,PSC-AVDN结合了三阶段的解析-搜索-确认推理流程与结构化空间记忆(SSM)。解析阶段利用大型语言模型(LLM)将模糊的对话指令转换为稳定的几何方向和目的地线索。搜索链思维(S-CoT)在高空观察下逐步探索目标,而确认链思维(C-CoT)则在候选区域进行细致验证以解决视觉模糊。SSM整合了多种空间线索,提供全球空间上下文和长时间一致性。实验结果表明,PSC-AVDN在无训练设置下达到了新的最优性能,超越了多种微调方法。

🔬 方法详解

问题定义:本文旨在解决高空无人机导航中的Aerial Vision-and-Dialog Navigation (AVDN)任务,现有方法在方向定位和空间记忆方面的不足导致导航不可靠。

核心思路:PSC-AVDN框架通过将解析、搜索和确认的推理流程与结构化空间记忆相结合,提供了一种无训练的高效导航解决方案。这样的设计旨在提升导航的稳定性和准确性。

技术框架:该框架包括三个主要阶段:解析阶段使用LLM将模糊指令转换为几何线索;搜索链思维(S-CoT)在高空观察下逐步探索目标;确认链思维(C-CoT)对候选区域进行细致验证。同时,结构化空间记忆(SSM)整合多种空间线索以提供全局上下文。

关键创新:PSC-AVDN的核心创新在于将三阶段推理流程与结构化空间记忆紧密结合,解决了现有方法在方向定位和空间记忆方面的不足,显著提升了导航的可靠性。

关键设计:在设计中,SSM整合了多尺度视觉观察、空间视觉记忆和结构化几何记忆,以提供全球空间上下文和长时间一致性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在ANDH和ANDH-Full数据集上的实验结果显示,PSC-AVDN在无训练设置下达到了新的最优性能,超越了多种微调方法,具体性能数据未提供,但整体提升幅度显著。

🎯 应用场景

该研究的潜在应用场景包括无人机在复杂环境中的自主导航、搜索与救援任务、以及智能城市中的物流配送等。其无训练的特性使得在资源受限的情况下仍能实现高效导航,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

In this paper, we tackle the Aerial Vision-and-Dialog Navigation (AVDN) task in the training-free setting for resource-efficient high-altitude UAV navigation.Naively applying MLLMs leads to unreliable navigation due to weak directional grounding and the lack of explicit spatial memory.To address these issues, we propose PSC-AVDN, a training-free framework that tightly couples a three-stage Parsing-Search-Confirmation reasoning pipeline with a Structured Spatial Memory (SSM).The parsing stage uses an LLM to convert ambiguous dialogue instructions into stable geometric directional and destination cues.A Search Chain-of-Thought (S-CoT) then performs stepwise target exploration under high-altitude observations, and a Confirmation Chain-of-Thought (C-CoT) conducts fine-grained verification around candidate regions to resolve visual ambiguity.Meanwhile, SSM integrates three complementary sources of spatial cues, including multi-scale visual observation, spatial visual memory, and structured geometric memory to provide global spatial context and long-horizon consistency.Extensive experiments on ANDH and ANDH-Full show that PSC-AVDN establishes new state-of-the-art performance in the training-free setting, matching or surpassing several finetuned methods.Code will be publicly available at: https://github.com/QY6616/PSC-AVDN