AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

📄 arXiv: 2607.11063v1 📥 PDF

作者: Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

分类: cs.AI

发布日期: 2026-07-13

备注: ACM International Conference on Multimedia 2026


💡 一句话要点

提出AdvNav以解决视觉语言导航中的黑箱对抗攻击问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 对抗攻击 视觉语言导航 黑箱攻击 行为引导 多步决策 优化策略 脆弱性评估

📋 核心要点

  1. 现有的对抗攻击方法大多依赖白箱访问,计算复杂且不适用于实际应用,且难以处理多步决策的复杂性。
  2. AdvNav框架通过行为引导的方式,利用可观察的输入和输出进行黑箱攻击,扰动导航过程中的第一人称视图。
  3. 在R2R数据集上,AdvNav在不同模型上实现了高达87.30%的攻击成功率,显示出其有效性和广泛适用性。

📝 摘要(中文)

尽管在具身人工智能领域取得了进展,视觉语言导航系统仍然容易受到对抗性视觉干扰的影响。现有方法大多依赖于对目标模型梯度的白箱访问,这在实际应用中往往不切实际且计算开销大。为此,本文提出了AdvNav,一个行为引导的黑箱对抗攻击框架,旨在通过扰动导航过程中的第一人称视图来有效干扰多步感知-行动循环。我们设计了双粒度行为反馈,聚合了轨迹级性能评分和动作级奖励评分,以指导无梯度搜索中的优化。实验结果表明,AdvNav在R2R数据集上对Transformer和LLM模型的攻击成功率分别达到了49.70%、65.96%和87.30%。

🔬 方法详解

问题定义:本文旨在解决视觉语言导航系统在面对对抗性视觉干扰时的脆弱性。现有方法通常依赖于白箱模型的梯度信息,导致计算开销大且不适用于实际场景。

核心思路:AdvNav框架通过行为引导的方式,设计了一种无梯度的对抗攻击方法,能够在黑箱环境中有效地扰动导航过程。该方法利用可观察的输入和输出,聚合多层次的反馈信息来指导优化。

技术框架:AdvNav的整体架构包括三个主要模块:行为反馈模块、优化策略模块和扰动生成模块。行为反馈模块负责提取代理的自输出行为信息,优化策略模块则根据反馈信息调整扰动强度,扰动生成模块负责生成最终的对抗样本。

关键创新:AdvNav的主要创新在于其双粒度行为反馈机制,结合了轨迹级和动作级的性能评分,能够更全面地评估导航过程中的决策风险。这一设计使得优化过程更加高效和精准。

关键设计:在参数设置上,AdvNav采用了自适应更新策略来调整扰动强度,并利用遗传算法进化噪声的空间结构,以迭代发现最具干扰性的噪声配置。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在R2R数据集上,AdvNav在不同模型上的攻击成功率分别为49.70%、65.96%和87.30%。这一结果不仅展示了AdvNav的有效性,还揭示了当前视觉语言导航系统的关键感知脆弱性,为未来的模型设计提供了重要的见解。

🎯 应用场景

AdvNav的研究成果可广泛应用于智能导航系统的安全性评估和增强,尤其是在机器人、自动驾驶和虚拟助手等领域。通过识别和利用系统的脆弱性,能够为未来的视觉语言导航模型设计提供重要的参考,提升其鲁棒性和安全性。

📄 摘要(原文)

Despite progress in Embodied AI, Vision-and-Language Navigation systems remain vulnerable to adversarial visual disturbances. Most existing methods rely on white-box access to target model gradients, which is often unrealistic for real-world deployed systems and computationally exhaustive due to recursive backpropagation for optimization, limiting their applicability. While previous black-box methods predominantly target single-step, instantaneous decision tasks, they struggle to handle the task complexities and temporal dependencies. This highlights the need for a gradient-free attack method that can effectively disrupt the multistep sequential perception-action loop using only observable inputs and outputs. Therefore, we propose AdvNav, a behavior-guided black-box adversarial attack framework that disturbs an agent's first-person views during navigation. To construct an informative surrogate objective for effective optimization guidance in gradient-free search under the black-box setting, we design a dual-granularity behavior-based feedback, aggregating a trajectory-level performance score representing overall navigation degradation, an action-level reward score considering the potential decision risk, and a deviation indicator, all of which are extracted from the agent's self-output behaviors. This feedback guides a hybrid optimization strategy that heuristically tunes perturbation strength via adaptive updates and evolves noise spatial structure genetically, to iteratively discover the most disruptive noise configuration. Evaluated against Transformer-based HAMT and LLM-based MapGPT with two types of backbones on R2R dataset, AdvNav achieves 49.70/65.96/87.30% Attack Success Rate. The result demonstrates the effectiveness and generality of AdvNav, reveals critical perception vulnerabilities and offers insights for the design of future resilient VLN models.