FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation
作者: Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian
分类: cs.RO, cs.AI
发布日期: 2026-07-09
💡 一句话要点
提出FSD-VLN以解决长距离无人机视觉语言导航中的决策延迟问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言导航 无人机 快慢双系统 扩散变换器 多模态理解 自适应优化器 长距离导航
📋 核心要点
- 现有视觉语言导航方法在全球多模态理解与顺序动作生成之间存在结构性不匹配,导致长距离导航时的决策延迟和轨迹抖动。
- 本文提出FSD-VLN,通过快慢双系统架构解耦语义推理与低延迟飞行指令生成,提升导航效率与稳定性。
- 大规模低空仿真实验表明,FSD-VLN在未见场景中的导航成功率提高了2倍,且推理延迟和任务运行时间均减少超过50%。
📝 摘要(中文)
视觉语言导航(VLN)使无人机能够在未知环境中自主导航,通过将语言指令映射到实时视觉输入。与依赖GPS或预编程导航的方法相比,VLN支持直观的人机交互和更强的环境适应性。然而,现有方法在全球多模态理解与顺序动作生成之间存在结构性不匹配,导致长距离导航时轨迹抖动和决策延迟。为了解决这一问题,本文提出了FSD-VLN,一种快慢双系统架构,解耦语义推理与低延迟飞行指令生成。该框架包含两个异步分支:慢流从预训练的视觉语言模型中提取稳定的语义先验,快流则通过扩散变换器(DiT)建模跨时间动作分布以生成一致的飞行输出。实验表明,FSD-VLN在未见场景中导航成功率比现有方法提高了2倍,同时单动作推理延迟和总任务运行时间减少超过50%。
🔬 方法详解
问题定义:本文旨在解决长距离无人机视觉语言导航中的决策延迟和轨迹抖动问题。现有方法在全球多模态理解与顺序动作生成之间存在结构性不匹配,导致性能下降。
核心思路:FSD-VLN采用快慢双系统架构,分别处理语义推理和飞行指令生成。慢流提取稳定的语义信息,快流则实时生成飞行指令,从而提高导航的稳定性和响应速度。
技术框架:FSD-VLN框架包含两个主要分支:慢流和快流。慢流从预训练的视觉语言模型中提取语义先验,而快流使用扩散变换器(DiT)建模跨时间的动作分布,确保飞行输出的一致性。
关键创新:FSD-VLN的主要创新在于解耦语义推理与飞行控制,采用双系统架构来分别处理高层语义与低延迟指令生成。这一设计显著改善了长距离导航的性能。
关键设计:在训练过程中,本文引入了时间感知自适应优化器,以稳定长序列训练并减少梯度振荡。此外,模型的参数设置和损失函数经过精心设计,以确保各个模块的协同工作。
🖼️ 关键图片
📊 实验亮点
实验结果显示,FSD-VLN在未见场景中的导航成功率比现有最先进方法提高了2倍,同时单动作推理延迟和总任务运行时间减少超过50%。这些结果验证了该方法在长距离视觉语言导航中的有效性。
🎯 应用场景
该研究的潜在应用领域包括无人机自主导航、智能交通系统以及搜索与救援任务等。通过提升无人机在复杂环境中的导航能力,FSD-VLN能够显著提高任务执行的效率和安全性,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Vision-Language Navigation (VLN) enables UAV autonomous navigation in unknown environments by mapping language instructions to real-time visual inputs. Compared with GPS-dependent or pre-programmed navigation, VLN supports intuitive human-machine interaction and stronger environmental adaptability, requiring tight integration of high-level semantic reasoning and low-latency flight control.Existing methods suffer from structural misalignment between global multimodal understanding and sequential action generation, causing jittery trajectories and severe decision latency for long-horizon aerial navigation. To solve this issue, we propose FSD-VLN, a fast-slow dual-system architecture disentangling semantic reasoning and low-latency flight command generation.The framework has two asynchronous branches: a slow stream extracting stable semantic priors from pre-trained vision-language models, and a Diffusion Transformer (DiT) fast stream modeling cross-temporal action distributions to produce consistent flight outputs. We further introduce a time-aware adaptive optimizer to stabilize long-sequence training and reduce gradient oscillation.Large-scale low-altitude simulation experiments show FSD-VLN achieves up to 2X higher navigation success rates on unseen scenes than SOTA methods, while cutting single-action inference delay and total task runtime by over 50%. Our work validates the benefit of decoupled semantic-control modeling and provides a practical paradigm for long-horizon aerial VLN.