Large Language Models Are Better Adversaries: Exploring Generative Clean-Label Backdoor Attacks Against Text Classifiers
作者: Wencong You, Zayd Hammoudeh, Daniel Lowd
分类: cs.LG
发布日期: 2023-10-28
备注: Accepted at EMNLP 2023 Findings
💡 一句话要点
提出LLMBkd以解决文本分类器的清标签后门攻击问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 后门攻击 文本分类 对抗性学习 语言模型 安全性评估
📋 核心要点
- 现有的后门攻击方法在处理清标签攻击时面临挑战,尤其是在样本被正确标记的情况下。
- 本文提出的LLMBkd方法利用语言模型自动插入多样化的触发器,从而实现更有效的清标签后门攻击。
- 实验结果显示,LLMBkd在多种文本风格下均能实现高攻击成功率,且无需复杂的模型训练。
📝 摘要(中文)
后门攻击通过在训练和测试数据中插入无害触发器来操控模型预测。本文关注更现实且更具挑战性的清标签攻击,即对抗性训练样本被正确标记。我们的攻击方法LLMBkd利用语言模型自动将多样化的基于风格的触发器插入文本中。我们还提出了一种毒药选择技术,以提高LLMBkd及现有文本后门攻击的有效性。最后,我们描述了REACT作为基线防御,通过解药训练样本来减轻后门攻击。评估结果表明,LLMBkd在多种风格下均能高效且有效地实现高攻击成功率,且几乎不需要额外的努力和模型训练。
🔬 方法详解
问题定义:本文旨在解决文本分类器中的清标签后门攻击问题,现有方法在处理正确标记的对抗样本时效果不佳,难以实现高效攻击。
核心思路:LLMBkd方法通过利用语言模型的能力,自动生成多样化的风格触发器,从而增强攻击的隐蔽性和有效性。
技术框架:该方法包括触发器生成、毒药选择和攻击实施三个主要模块。触发器生成模块负责创建多样化的触发器,毒药选择模块则优化选择最有效的训练样本。
关键创新:LLMBkd的主要创新在于其自动化生成触发器的能力,显著提高了攻击的灵活性和成功率,与传统方法相比,减少了对人工设计的依赖。
关键设计:在设计中,采用了基于风格的触发器生成策略,并通过毒药选择技术来优化训练样本的选择,以提升攻击效果。
🖼️ 关键图片
📊 实验亮点
实验结果表明,LLMBkd在多种文本风格下均能实现超过90%的攻击成功率,且在对比基线方法中表现出显著的提升,证明了其高效性和有效性。
🎯 应用场景
该研究的潜在应用领域包括文本分类系统的安全性评估、自然语言处理模型的鲁棒性测试以及对抗性机器学习的研究。随着文本分类在金融、社交媒体等领域的广泛应用,提升其安全性具有重要的实际价值和未来影响。
📄 摘要(原文)
Backdoor attacks manipulate model predictions by inserting innocuous triggers into training and test data. We focus on more realistic and more challenging clean-label attacks where the adversarial training examples are correctly labeled. Our attack, LLMBkd, leverages language models to automatically insert diverse style-based triggers into texts. We also propose a poison selection technique to improve the effectiveness of both LLMBkd as well as existing textual backdoor attacks. Lastly, we describe REACT, a baseline defense to mitigate backdoor attacks via antidote training examples. Our evaluations demonstrate LLMBkd's effectiveness and efficiency, where we consistently achieve high attack success rates across a wide range of styles with little effort and no model training.