Technical Report on the CVPR 2026@AdvML Workshop Challenge
作者: Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao
分类: cs.CV, cs.AI
发布日期: 2026-07-13
💡 一句话要点
提出对抗性多模态攻击以增强自动驾驶视觉语言代理的鲁棒性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗性攻击 视觉语言代理 自动驾驶 多模态学习 鲁棒性评估 安全性设计 图像处理
📋 核心要点
- 现有的视觉语言代理在应对复杂驾驶场景时容易受到对抗性攻击,导致安全性和可靠性不足。
- 本研究设计了一个挑战,要求参与者生成对抗性图像和文本扰动,以测试和提升自动驾驶VLA的鲁棒性。
- 实验结果显示,场景级多视角优化优于单视角处理,且图像侧攻击受到后缀惩罚的影响,提供了有效的攻击策略。
📝 摘要(中文)
视觉语言代理(VLA)在解释复杂驾驶场景和支持安全关键推理方面的应用日益增加。本报告介绍了CVPR 2026@AdvML研讨会挑战,聚焦于针对自动驾驶VLA的对抗性多模态攻击。挑战基于DriveLM风格的多视角视觉问答,使用六个同步摄像头图像和结构化的驾驶相关问答对来表示每个场景。参与者需生成对抗性图像和仅后缀的文本扰动,以使模型响应偏离参考答案,同时保持图像的保真度和限制文本成本。竞赛分为两个阶段,第二阶段增加了隐蔽的黑箱模型以评估可迁移性。我们描述了任务设计、提交规则、评估协议和排行榜结果,并分析了五个领先提交的技术报告。这些发现为未来多模态自动驾驶系统的鲁棒性评估和防御设计提供了实用参考。
🔬 方法详解
问题定义:本研究旨在解决自动驾驶视觉语言代理在复杂场景下的对抗性攻击问题,现有方法在鲁棒性和安全性方面存在不足。
核心思路:通过设计一个多模态挑战,参与者需生成对抗性图像和文本扰动,以使模型的输出偏离参考答案,从而评估和提升VLA的鲁棒性。
技术框架:整体框架包括两个阶段:第一阶段为生成对抗性样本,第二阶段引入隐蔽的黑箱模型以评估攻击的可迁移性。主要模块包括图像生成、文本扰动和模型评估。
关键创新:本研究的创新在于结合多视角视觉问答与对抗性攻击,提出了基于场景级优化的攻击策略,与传统方法相比,能够更有效地利用攻击预算。
关键设计:在参数设置上,采用了特定的损失函数以平衡图像保真度与文本扰动的成本,同时设计了图像和文本的联合优化策略,以提高攻击效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,采用场景级多视角优化的攻击策略,相较于传统的单视角处理,能够显著提高对抗性攻击的有效性。此外,嵌入图像中的排版内容被发现是VLA的一个持久性漏洞,为未来的防御设计提供了重要参考。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶系统的安全性评估和防御设计,尤其是在复杂和动态的驾驶环境中。通过提升视觉语言代理的鲁棒性,可以有效减少安全事故的发生,增强自动驾驶技术的可靠性和用户信任度。
📄 摘要(原文)
Vision-language agents (VLAs) are increasingly used to interpret complex driving scenes and support safety-critical reasoning. This report presents the CVPR 2026@AdvML Workshop Challenge on adversarial multimodal attacks against autonomous-driving VLAs. Built on DriveLM-style multi-view visual question answering, the challenge represents each scene with six synchronized camera images and a structured collection of driving-related question-answer pairs. Participants generate adversarial images and suffix-only textual perturbations that induce model responses to deviate from reference answers while preserving image fidelity and limiting textual cost. The competition comprises two phases, with Phase II adding a hidden black-box model to assess transferability. We describe the task design, submission rules, evaluation protocol, and leaderboard results, and then examine five leading submissions for which technical reports were available. Across these reports, several recurring patterns emerge: image-side attacks are favored by the suffix penalty; scene-level, multi-view optimization is more effective than treating views in isolation; QA types and graph structure provide useful priors for allocating attack budget; feature-space objectives can improve black-box transfer; and typographic content embedded in camera images exposes a persistent vulnerability in driving VLAs. These findings provide a practical reference for future robustness evaluation and defense design in multimodal autonomous-driving systems.