Jailbreaking Black Box Large Language Models in Twenty Queries
作者: Patrick Chao, Alexander Robey, Edgar Dobriban, Hamed Hassani, George J. Pappas, Eric Wong
分类: cs.LG, cs.AI
发布日期: 2023-10-12 (更新: 2024-07-18)
💡 一句话要点
提出PAIR算法以高效识别大型语言模型的安全漏洞
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 安全漏洞 对抗性攻击 自动化优化 迭代查询
📋 核心要点
- 现有方法在识别大型语言模型的安全漏洞时效率低下,且容易受到人工干预的影响。
- 本文提出的PAIR算法通过黑箱访问,利用攻击者LLM自动生成并迭代优化越狱,显著提高了效率。
- 实验结果表明,PAIR算法通常在不到二十次查询内成功生成越狱,且在多种LLM上表现出色。
📝 摘要(中文)
随着对大型语言模型(LLMs)与人类价值观对齐的关注增加,这些模型的对齐性却容易受到对抗性越狱攻击的影响,导致其安全防护被绕过。因此,识别这些漏洞对于理解模型的内在弱点和防止未来的误用至关重要。为此,本文提出了Prompt Automatic Iterative Refinement(PAIR)算法,该算法仅通过黑箱访问生成语义越狱。PAIR受社交工程攻击的启发,利用攻击者LLM自动生成针对目标LLM的越狱,无需人工干预。通过迭代查询,攻击者LLM更新和完善候选越狱。实验证明,PAIR通常只需不到二十次查询即可生成越狱,效率远超现有算法,并在开源和闭源LLM(如GPT-3.5/4、Vicuna和Gemini)上实现了竞争性的越狱成功率和可转移性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型(LLMs)在对齐人类价值观时面临的安全漏洞问题。现有方法往往效率低下,且依赖人工干预,难以快速识别和利用这些漏洞。
核心思路:论文提出的PAIR算法通过黑箱访问,利用一个攻击者LLM自动生成针对目标LLM的越狱,避免了人工干预的需求。该方法通过迭代查询的方式,不断更新和优化越狱策略。
技术框架:PAIR的整体架构包括两个主要模块:攻击者LLM和目标LLM。攻击者LLM负责生成初始越狱并通过与目标LLM的交互进行迭代优化,最终形成有效的越狱策略。
关键创新:PAIR算法的最大创新在于其高效性和自动化程度,通常只需不到二十次查询即可成功生成越狱,这一效率远超现有的越狱方法。
关键设计:在设计上,PAIR算法通过精细的查询策略和反馈机制,确保攻击者LLM能够有效地学习目标LLM的响应,从而不断改进越狱效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,PAIR算法在多种大型语言模型上表现出色,通常只需不到二十次查询即可成功生成越狱,成功率和可转移性均与现有方法相比具有显著优势,展现出极高的效率和实用性。
🎯 应用场景
该研究的潜在应用领域包括安全审计、模型评估和对抗性测试等。通过识别和修复大型语言模型的安全漏洞,能够提高其在实际应用中的安全性和可靠性,防止潜在的滥用行为。未来,PAIR算法可能会推动更安全的AI系统设计和开发。
📄 摘要(原文)
There is growing interest in ensuring that large language models (LLMs) align with human values. However, the alignment of such models is vulnerable to adversarial jailbreaks, which coax LLMs into overriding their safety guardrails. The identification of these vulnerabilities is therefore instrumental in understanding inherent weaknesses and preventing future misuse. To this end, we propose Prompt Automatic Iterative Refinement (PAIR), an algorithm that generates semantic jailbreaks with only black-box access to an LLM. PAIR -- which is inspired by social engineering attacks -- uses an attacker LLM to automatically generate jailbreaks for a separate targeted LLM without human intervention. In this way, the attacker LLM iteratively queries the target LLM to update and refine a candidate jailbreak. Empirically, PAIR often requires fewer than twenty queries to produce a jailbreak, which is orders of magnitude more efficient than existing algorithms. PAIR also achieves competitive jailbreaking success rates and transferability on open and closed-source LLMs, including GPT-3.5/4, Vicuna, and Gemini.