Black-box Targeted Adversarial Attack on Segment Anything (SAM)
作者: Sheng Zheng, Chaoning Zhang, Xinhong Hao
分类: cs.CV
发布日期: 2023-10-16 (更新: 2024-02-28)
💡 一句话要点
提出黑箱针对性对抗攻击方法以评估SAM模型的鲁棒性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗攻击 计算机视觉 模型鲁棒性 深度学习 黑箱攻击
📋 核心要点
- 现有方法在进行针对性对抗攻击时依赖于模型提示和结构,限制了其实际应用的灵活性。
- 本研究提出了一种仅针对图像编码器的攻击方法,避免了对模型提示的依赖,从而提高了攻击的通用性。
- 实验结果表明,所提方法在黑箱设置下成功实现了对SAM的针对性对抗攻击,验证了其有效性和可行性。
📝 摘要(中文)
深度识别模型普遍容易受到对抗样本的影响,这些样本通过对输入图像添加几乎不可察觉的扰动来改变模型输出。最近,Segment Anything Model(SAM)因其对未见数据和任务的出色泛化能力而成为计算机视觉领域的热门基础模型。为了理解SAM在对抗环境下的鲁棒性,本研究旨在实现对SAM的针对性对抗攻击(TAA)。在特定提示下,目标是使对抗样本的预测掩码与给定目标图像相似。现有研究在白箱设置下实现了TAA,但假设访问提示和模型,这在实际应用中不够可行。为了解决提示依赖性问题,我们提出了一种简单而有效的方法,仅对图像编码器进行攻击。此外,我们提出了一种新颖的正则化损失,以通过增强对抗图像相对于随机自然图像的特征主导性来提高跨模型的可迁移性。大量实验验证了我们提出的简单技术在SAM上成功实现黑箱TAA的有效性。
🔬 方法详解
问题定义:本研究旨在解决对Segment Anything Model(SAM)进行针对性对抗攻击时的提示依赖性问题。现有方法通常需要对模型的内部结构和提示信息有明确的访问,这在实际应用中存在局限性。
核心思路:论文提出了一种新的攻击策略,专注于仅攻击图像编码器,而不依赖于模型提示。这种设计使得攻击方法更加灵活和实用,能够在黑箱环境中有效实施。
技术框架:整体架构包括图像输入、图像编码器、对抗样本生成模块和正则化损失计算。首先,输入图像经过编码器处理,然后生成对抗样本,最后通过正则化损失增强对抗样本的特征主导性。
关键创新:最重要的技术创新是提出了一种新颖的正则化损失,旨在提高对抗样本在不同模型间的可迁移性。这一创新与现有方法的本质区别在于不再依赖于模型的具体结构和提示信息。
关键设计:在参数设置上,研究者对正则化损失进行了精细调整,以确保对抗样本在特征空间中占据主导地位。此外,网络结构设计上,重点优化了图像编码器的输出,以提高攻击效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提黑箱针对性对抗攻击方法在多个测试场景中均成功实现了对SAM的攻击,攻击成功率显著高于传统方法,验证了新方法的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉中的安全性评估、模型鲁棒性分析以及对抗样本生成等。通过理解和评估SAM等基础模型的鲁棒性,能够为未来的模型设计和优化提供重要参考,提升实际应用中的安全性和可靠性。
📄 摘要(原文)
Deep recognition models are widely vulnerable to adversarial examples, which change the model output by adding quasi-imperceptible perturbation to the image input. Recently, Segment Anything Model (SAM) has emerged to become a popular foundation model in computer vision due to its impressive generalization to unseen data and tasks. Realizing flexible attacks on SAM is beneficial for understanding the robustness of SAM in the adversarial context. To this end, this work aims to achieve a targeted adversarial attack (TAA) on SAM. Specifically, under a certain prompt, the goal is to make the predicted mask of an adversarial example resemble that of a given target image. The task of TAA on SAM has been realized in a recent arXiv work in the white-box setup by assuming access to prompt and model, which is thus less practical. To address the issue of prompt dependence, we propose a simple yet effective approach by only attacking the image encoder. Moreover, we propose a novel regularization loss to enhance the cross-model transferability by increasing the feature dominance of adversarial images over random natural images. Extensive experiments verify the effectiveness of our proposed simple techniques to conduct a successful black-box TAA on SAM.