Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation

📄 arXiv: 2310.06987v1 📥 PDF

作者: Yangsibo Huang, Samyak Gupta, Mengzhou Xia, Kai Li, Danqi Chen

分类: cs.CL, cs.AI, cs.CR

发布日期: 2023-10-10

🔗 代码/项目: GITHUB


💡 一句话要点

提出生成利用攻击以解决开源LLM的监控失效问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 开源LLM 生成利用攻击 模型对齐 安全评估 人工智能伦理

📋 核心要点

  1. 当前开源LLM在安全评估和对齐程序中存在重大缺陷,导致模型易受恶意操控。
  2. 提出生成利用攻击,通过操控解码方法的变体,极大地提高模型的误对齐率。
  3. 实验结果显示,11个语言模型的误对齐率从0%提升至95%以上,且计算成本显著降低。

📝 摘要(中文)

开源大型语言模型(LLMs)的快速发展显著推动了人工智能的发展。在模型发布前,广泛努力旨在使其行为与人类价值观对齐,以确保其有益和无害。然而,即使是经过仔细对齐的模型也可能被恶意操控,导致意外行为,称为“越狱”。本文提出了一种生成利用攻击,通过仅操控解码方法的变体,极大地破坏了模型的对齐。通过利用不同的生成策略,我们将11个语言模型的误对齐率从0%提高到超过95%,并且计算成本降低了30倍。最后,我们提出了一种有效的对齐方法,能够合理降低在我们攻击下的误对齐率。

🔬 方法详解

问题定义:本研究旨在解决开源大型语言模型(LLMs)在对齐过程中存在的安全漏洞,现有方法在面对特定输入时容易被操控,导致意外行为的发生。

核心思路:论文提出的生成利用攻击通过简单地操控解码方法的变体,来破坏模型的对齐,展示了不同生成策略的有效性。

技术框架:整体架构包括生成利用攻击的实施阶段,利用不同的解码超参数和采样方法来增加误对齐率,同时还提出了一种新的对齐方法以应对攻击。

关键创新:最重要的技术创新在于通过简单的生成策略操控实现了高达95%的误对齐率,且计算成本比现有方法低30倍,显著提高了攻击的有效性。

关键设计:在实验中,关键参数包括解码超参数的选择和采样方法的变化,这些设计使得模型在面对特定输入时表现出极大的脆弱性。通过对比不同模型的表现,验证了提出方法的有效性。

📊 实验亮点

实验结果显示,研究团队成功将11个语言模型的误对齐率从0%提升至超过95%,并且在计算成本上降低了30倍,显著优于现有的攻击方法。这一成果强调了当前安全评估和对齐程序的不足之处。

🎯 应用场景

该研究的潜在应用领域包括安全评估、模型对齐和人工智能伦理等。通过揭示开源LLM的脆弱性,可以推动更严格的安全标准和对齐方法的开发,从而提高模型的可靠性和安全性,对未来的AI系统设计具有重要影响。

📄 摘要(原文)

The rapid progress in open-source large language models (LLMs) is significantly advancing AI development. Extensive efforts have been made before model release to align their behavior with human values, with the primary goal of ensuring their helpfulness and harmlessness. However, even carefully aligned models can be manipulated maliciously, leading to unintended behaviors, known as "jailbreaks". These jailbreaks are typically triggered by specific text inputs, often referred to as adversarial prompts. In this work, we propose the generation exploitation attack, an extremely simple approach that disrupts model alignment by only manipulating variations of decoding methods. By exploiting different generation strategies, including varying decoding hyper-parameters and sampling methods, we increase the misalignment rate from 0% to more than 95% across 11 language models including LLaMA2, Vicuna, Falcon, and MPT families, outperforming state-of-the-art attacks with $30\times$ lower computational cost. Finally, we propose an effective alignment method that explores diverse generation strategies, which can reasonably reduce the misalignment rate under our attack. Altogether, our study underscores a major failure in current safety evaluation and alignment procedures for open-source LLMs, strongly advocating for more comprehensive red teaming and better alignment before releasing such models. Our code is available at https://github.com/Princeton-SysML/Jailbreak_LLM.