Misusing Tools in Large Language Models With Visual Adversarial Examples
作者: Xiaohan Fu, Zihan Wang, Shuheng Li, Rajesh K. Gupta, Niloofar Mireshghallah, Taylor Berg-Kirkpatrick, Earlence Fernandes
分类: cs.CR, cs.AI
发布日期: 2023-10-04
💡 一句话要点
提出视觉对抗样本以操控大型语言模型工具使用
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗样本 大型语言模型 安全性 工具使用 多模态AI
📋 核心要点
- 现有的大型语言模型在使用工具时面临新的安全风险,攻击者可以通过视觉对抗样本操控其行为。
- 论文提出了一种基于梯度的对抗训练方法,能够生成隐蔽的视觉对抗样本以影响LLM的工具使用。
- 实验结果表明,生成的对抗图像在98%的情况下能够成功操控LLM调用工具,同时保持与原始图像的高相似度。
📝 摘要(中文)
大型语言模型(LLMs)正在增强其使用工具和处理多模态的能力,这带来了新的好处和安全风险。本文展示了攻击者可以利用视觉对抗样本导致目标LLM执行攻击者希望的工具使用,例如删除日历事件、泄露私人对话和预订酒店。与以往研究不同,我们的攻击可以影响与LLM连接的用户资源的机密性和完整性,同时保持隐蔽性并对多种输入提示具有可推广性。我们通过基于梯度的对抗训练构建这些攻击,并在多个维度上表征其性能。我们的对抗图像几乎总是(约98%)能够操控LLM按照真实世界的语法调用工具,同时与干净图像保持高相似度(约0.9 SSIM)。此外,使用人工评分和自动化指标,我们发现这些攻击不会明显影响用户与LLM之间的对话及其语义。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在工具使用过程中面临的安全风险,尤其是攻击者利用视觉对抗样本操控模型行为的问题。现有方法未能有效防范此类攻击,导致用户资源的机密性和完整性受到威胁。
核心思路:论文的核心思路是通过生成视觉对抗样本,利用模型对图像的理解能力,诱导其执行攻击者指定的工具操作。通过这种方式,攻击者可以在不被察觉的情况下影响模型的决策。
技术框架:整体架构包括对抗样本的生成、性能评估和攻击效果验证三个主要模块。首先,通过梯度下降方法生成对抗样本;其次,评估这些样本对模型工具调用的影响;最后,通过人类评分和自动化指标验证攻击效果。
关键创新:本研究的关键创新在于提出了一种隐蔽且可推广的对抗攻击方法,能够在多种输入提示下有效操控LLM的工具使用。这与现有方法的本质区别在于其对用户对话语义的影响极小。
关键设计:在对抗样本生成过程中,采用了特定的损失函数以确保生成图像与原始图像的高相似度(约0.9 SSIM),同时保持对模型决策的强影响力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,生成的对抗图像在98%的情况下成功诱导LLM调用工具,同时与干净图像的相似度保持在约0.9 SSIM。此外,攻击对用户与LLM之间的对话语义没有显著影响,表明其隐蔽性和有效性。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的安全性评估和防护措施的设计。通过理解对抗样本的影响,开发者可以增强模型的鲁棒性,防止恶意攻击,从而保护用户数据的安全性。未来,该研究可能推动对抗训练技术在多模态AI系统中的广泛应用。
📄 摘要(原文)
Large Language Models (LLMs) are being enhanced with the ability to use tools and to process multiple modalities. These new capabilities bring new benefits and also new security risks. In this work, we show that an attacker can use visual adversarial examples to cause attacker-desired tool usage. For example, the attacker could cause a victim LLM to delete calendar events, leak private conversations and book hotels. Different from prior work, our attacks can affect the confidentiality and integrity of user resources connected to the LLM while being stealthy and generalizable to multiple input prompts. We construct these attacks using gradient-based adversarial training and characterize performance along multiple dimensions. We find that our adversarial images can manipulate the LLM to invoke tools following real-world syntax almost always (~98%) while maintaining high similarity to clean images (~0.9 SSIM). Furthermore, using human scoring and automated metrics, we find that the attacks do not noticeably affect the conversation (and its semantics) between the user and the LLM.