SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks

📄 arXiv: 2310.03684v4 📥 PDF

作者: Alexander Robey, Eric Wong, Hamed Hassani, George J. Pappas

分类: cs.LG, cs.AI, stat.ML

发布日期: 2023-10-05 (更新: 2024-06-11)

🔗 代码/项目: GITHUB


💡 一句话要点

提出SmoothLLM以防御大型语言模型的越狱攻击

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 越狱攻击 对抗性防御 鲁棒性 安全性

📋 核心要点

  1. 现有的大型语言模型容易受到越狱攻击,导致生成不当内容,影响其安全性和可靠性。
  2. SmoothLLM通过随机扰动输入提示的多个副本并聚合预测,来检测和防御越狱攻击,提升模型的鲁棒性。
  3. 在多种流行的LLM上,SmoothLLM在抵御多种越狱攻击方面表现出色,且与现有方法相比,具有更好的防御能力。

📝 摘要(中文)

尽管已有努力使大型语言模型(LLMs)与人类意图对齐,但广泛使用的LLMs如GPT、Llama和Claude仍然容易受到越狱攻击,即对手诱使目标LLM生成不当内容。为了解决这一脆弱性,本文提出了SmoothLLM,这是首个旨在减轻越狱攻击的算法。基于我们发现对抗性生成的提示对字符级变化敏感,我们的防御方法随机扰动给定输入提示的多个副本,然后聚合相应的预测以检测对抗性输入。在多种流行LLM上,SmoothLLM在抵御GCG、PAIR、RandomSearch和AmpleGCG越狱攻击方面设定了最先进的鲁棒性标准。SmoothLLM还对自适应GCG攻击具有抵抗力,表现出鲁棒性与名义性能之间的小但不可忽视的权衡,并且与任何LLM兼容。我们的代码已公开发布。

🔬 方法详解

问题定义:本文旨在解决大型语言模型(LLMs)在面对越狱攻击时的脆弱性。现有方法未能有效防止对手诱导模型生成不当内容,导致安全隐患。

核心思路:SmoothLLM的核心思路是利用对抗性生成提示对字符级变化的敏感性,通过随机扰动输入提示的多个副本来增强模型的鲁棒性,从而有效检测对抗性输入。

技术框架:SmoothLLM的整体架构包括输入扰动模块、预测聚合模块和对抗性检测模块。输入扰动模块生成多个扰动的提示,预测聚合模块收集各个副本的输出,最后通过对抗性检测模块判断输入的安全性。

关键创新:SmoothLLM的主要创新在于首次提出通过随机扰动输入提示来增强模型对越狱攻击的防御能力。这种方法与传统的防御机制不同,能够有效应对多种类型的越狱攻击。

关键设计:在设计中,SmoothLLM设置了多个扰动参数,以确保生成的提示具有多样性。同时,聚合预测的方式采用了加权平均,以提高对抗性输入的检测精度。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SmoothLLM在多种流行的LLM上表现出色,成功抵御了GCG、PAIR、RandomSearch和AmpleGCG等多种越狱攻击,设定了最先进的鲁棒性标准。尽管存在鲁棒性与名义性能之间的小权衡,但整体性能仍然优于现有方法,展现出显著的防御能力。

🎯 应用场景

SmoothLLM的研究成果具有广泛的应用潜力,尤其在需要确保内容生成安全性的领域,如社交媒体、在线客服和教育等。通过增强大型语言模型的安全性,该技术能够有效防止不当内容的生成,提升用户体验和信任度。

📄 摘要(原文)

Despite efforts to align large language models (LLMs) with human intentions, widely-used LLMs such as GPT, Llama, and Claude are susceptible to jailbreaking attacks, wherein an adversary fools a targeted LLM into generating objectionable content. To address this vulnerability, we propose SmoothLLM, the first algorithm designed to mitigate jailbreaking attacks. Based on our finding that adversarially-generated prompts are brittle to character-level changes, our defense randomly perturbs multiple copies of a given input prompt, and then aggregates the corresponding predictions to detect adversarial inputs. Across a range of popular LLMs, SmoothLLM sets the state-of-the-art for robustness against the GCG, PAIR, RandomSearch, and AmpleGCG jailbreaks. SmoothLLM is also resistant against adaptive GCG attacks, exhibits a small, though non-negligible trade-off between robustness and nominal performance, and is compatible with any LLM. Our code is publicly available at \url{https://github.com/arobey1/smooth-llm}.