Composite Backdoor Attacks Against Large Language Models
作者: Hai Huang, Zhengyu Zhao, Michael Backes, Yun Shen, Yang Zhang
分类: cs.CR, cs.CL, cs.LG
发布日期: 2023-10-11 (更新: 2024-03-30)
备注: To Appear in Findings of the Association for Computational Linguistics: NAACL 2024, June 2024
💡 一句话要点
提出复合后门攻击以增强大语言模型的安全性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 后门攻击 大语言模型 安全性研究 自然语言处理 多模态任务
📋 核心要点
- 现有的大语言模型在安全性方面存在隐患,尤其是第三方模型可能引入后门攻击,影响下游任务的可靠性。
- 本文提出复合后门攻击(CBA),通过在不同提示组件中分散多个触发键,确保后门仅在所有触发键同时出现时激活,从而提升隐蔽性。
- 实验结果显示,CBA在LLaMA-7B模型上以3%的中毒样本实现了100%的攻击成功率,且误触发率低于2.06%,几乎不影响模型性能。
📝 摘要(中文)
大语言模型(LLMs)在多种任务中表现优异,然而不可信的第三方LLMs可能会隐秘地引入漏洞。本文通过后门攻击的视角探讨LLMs的脆弱性。与现有方法不同,我们提出的复合后门攻击(CBA)在不同的提示组件中散布多个触发键,确保只有在所有触发键出现时才激活后门。实验表明,CBA在自然语言处理和多模态任务中均有效。以LLaMA-7B模型为例,在Emotion数据集上,使用3%的中毒样本实现了100%的攻击成功率,误触发率低于2.06%,且模型准确率几乎没有下降。我们的研究强调了对基础LLMs可信性进行安全研究的必要性。
🔬 方法详解
问题定义:本文旨在解决大语言模型(LLMs)在面对后门攻击时的脆弱性,现有方法往往集中在单一组件中植入触发键,导致攻击易被识别。
核心思路:提出复合后门攻击(CBA),通过在多个提示组件中分散触发键,确保后门仅在所有触发键同时出现时激活,从而增强攻击的隐蔽性和有效性。
技术框架:CBA的整体架构包括触发键的设计、后门激活机制以及对模型的影响评估。首先,在不同组件中设计多个触发键;其次,确保后门仅在所有触发键同时出现时激活;最后,通过实验验证攻击的成功率和模型性能。
关键创新:CBA的主要创新在于通过分散触发键的方式提升后门攻击的隐蔽性,与传统方法相比,显著降低了被检测的风险。
关键设计:在实验中,设置了3%的中毒样本比例,采用了LLaMA-7B模型,并在Emotion数据集上进行测试,确保了攻击成功率和误触发率的优化。
📊 实验亮点
实验结果显示,复合后门攻击在LLaMA-7B模型上以3%的中毒样本实现了100%的攻击成功率,且误触发率低于2.06%。这一结果表明,CBA在隐蔽性和有效性方面均优于传统后门攻击方法,几乎不影响模型的整体性能。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能客服和内容生成等场景,能够帮助开发者识别和防范潜在的安全威胁,提升大语言模型的可信性和安全性。未来,随着大语言模型的广泛应用,增强其安全性将成为重要的研究方向。
📄 摘要(原文)
Large language models (LLMs) have demonstrated superior performance compared to previous methods on various tasks, and often serve as the foundation models for many researches and services. However, the untrustworthy third-party LLMs may covertly introduce vulnerabilities for downstream tasks. In this paper, we explore the vulnerability of LLMs through the lens of backdoor attacks. Different from existing backdoor attacks against LLMs, ours scatters multiple trigger keys in different prompt components. Such a Composite Backdoor Attack (CBA) is shown to be stealthier than implanting the same multiple trigger keys in only a single component. CBA ensures that the backdoor is activated only when all trigger keys appear. Our experiments demonstrate that CBA is effective in both natural language processing (NLP) and multimodal tasks. For instance, with $3\%$ poisoning samples against the LLaMA-7B model on the Emotion dataset, our attack achieves a $100\%$ Attack Success Rate (ASR) with a False Triggered Rate (FTR) below $2.06\%$ and negligible model accuracy degradation. Our work highlights the necessity of increased security research on the trustworthiness of foundation LLMs.