Low-Resource Languages Jailbreak GPT-4

📄 arXiv: 2310.02446v2 📥 PDF

作者: Zheng-Xin Yong, Cristina Menghini, Stephen H. Bach

分类: cs.CL, cs.AI, cs.CR, cs.LG

发布日期: 2023-10-03 (更新: 2024-01-27)

备注: NeurIPS Workshop on Socially Responsible Language Modelling Research (SoLaR) 2023. Best Paper Award


💡 一句话要点

揭示低资源语言对GPT-4安全机制的跨语言脆弱性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 低资源语言 跨语言脆弱性 安全机制 大型语言模型 翻译API AI安全性 红队测试

📋 核心要点

  1. 现有的安全训练和红队测试方法在处理低资源语言时存在显著的脆弱性,导致不安全内容的生成风险增加。
  2. 本研究通过翻译不安全的英语输入为低资源语言,成功绕过了GPT-4的安全机制,揭示了跨语言的安全隐患。
  3. 实验结果表明,GPT-4对低资源语言的攻击成功率高达79%,显著高于其他高/中资源语言,显示出跨语言脆弱性的严重性。

📝 摘要(中文)

本研究揭示了大型语言模型(LLMs)安全机制的跨语言脆弱性,特别是在低资源语言中。通过将不安全的英语输入翻译为低资源语言,成功绕过了GPT-4的安全防护。在AdvBenchmark上的实验显示,GPT-4对这些翻译后的不安全输入的响应率高达79%,与最先进的越狱攻击相当或更高。这一发现不仅影响了低资源语言的使用者,也对所有LLMs用户构成了风险,呼吁更全面的多语言安全防护措施。

🔬 方法详解

问题定义:本研究旨在解决大型语言模型(LLMs)在低资源语言环境下的安全机制脆弱性。现有方法在处理低资源语言时,因训练数据不足而导致安全防护失效,增加了不安全内容生成的风险。

核心思路:论文的核心思路是通过将不安全的英语输入翻译为低资源语言,从而绕过GPT-4的安全防护。这种方法利用了低资源语言在安全训练数据中的不足,揭示了跨语言的脆弱性。

技术框架:研究采用了翻译API将不安全的英语输入转换为低资源语言,并在AdvBenchmark上进行测试。主要模块包括输入翻译、模型响应和结果评估。

关键创新:最重要的技术创新在于识别并利用低资源语言的训练不足,成功绕过了GPT-4的安全机制。这一发现与现有方法的本质区别在于其跨语言的攻击策略。

关键设计:在实验中,使用了公共翻译API进行输入转换,评估了不同语言的攻击成功率。关键参数包括翻译的准确性和模型对翻译输入的响应能力。

🖼️ 关键图片

img_0

📊 实验亮点

实验结果显示,GPT-4对翻译后的不安全输入的响应率高达79%,与最先进的越狱攻击相当或更高。相比之下,其他高/中资源语言的攻击成功率显著较低,表明跨语言脆弱性主要集中在低资源语言上。

🎯 应用场景

该研究的潜在应用领域包括AI安全性评估、跨语言内容监控和多语言模型的安全防护设计。通过识别和修复低资源语言的脆弱性,可以提升大型语言模型在全球范围内的安全性和可靠性,减少不安全内容的生成风险。

📄 摘要(原文)

AI safety training and red-teaming of large language models (LLMs) are measures to mitigate the generation of unsafe content. Our work exposes the inherent cross-lingual vulnerability of these safety mechanisms, resulting from the linguistic inequality of safety training data, by successfully circumventing GPT-4's safeguard through translating unsafe English inputs into low-resource languages. On the AdvBenchmark, GPT-4 engages with the unsafe translated inputs and provides actionable items that can get the users towards their harmful goals 79% of the time, which is on par with or even surpassing state-of-the-art jailbreaking attacks. Other high-/mid-resource languages have significantly lower attack success rate, which suggests that the cross-lingual vulnerability mainly applies to low-resource languages. Previously, limited training on low-resource languages primarily affects speakers of those languages, causing technological disparities. However, our work highlights a crucial shift: this deficiency now poses a risk to all LLMs users. Publicly available translation APIs enable anyone to exploit LLMs' safety vulnerabilities. Therefore, our work calls for a more holistic red-teaming efforts to develop robust multilingual safeguards with wide language coverage.