Large Language Models Are Better Adversaries: Exploring Generative Clean-Label Backdoor Attacks Against Text Classifiers

📄 arXiv: 2310.18603v1 📥 PDF

作者: Wencong You, Zayd Hammoudeh, Daniel Lowd

分类: cs.LG

发布日期: 2023-10-28

备注: Accepted at EMNLP 2023 Findings


💡 一句话要点

提出LLMBkd以解决文本分类器的清标签后门攻击问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 后门攻击 文本分类 对抗性学习 语言模型 安全性评估

📋 核心要点

  1. 现有的后门攻击方法在处理清标签攻击时面临挑战,尤其是在样本被正确标记的情况下。
  2. 本文提出的LLMBkd方法利用语言模型自动插入多样化的触发器,从而实现更有效的清标签后门攻击。
  3. 实验结果显示,LLMBkd在多种文本风格下均能实现高攻击成功率,且无需复杂的模型训练。

📝 摘要(中文)

后门攻击通过在训练和测试数据中插入无害触发器来操控模型预测。本文关注更现实且更具挑战性的清标签攻击,即对抗性训练样本被正确标记。我们的攻击方法LLMBkd利用语言模型自动将多样化的基于风格的触发器插入文本中。我们还提出了一种毒药选择技术,以提高LLMBkd及现有文本后门攻击的有效性。最后,我们描述了REACT作为基线防御,通过解药训练样本来减轻后门攻击。评估结果表明,LLMBkd在多种风格下均能高效且有效地实现高攻击成功率,且几乎不需要额外的努力和模型训练。

🔬 方法详解

问题定义:本文旨在解决文本分类器中的清标签后门攻击问题,现有方法在处理正确标记的对抗样本时效果不佳,难以实现高效攻击。

核心思路:LLMBkd方法通过利用语言模型的能力,自动生成多样化的风格触发器,从而增强攻击的隐蔽性和有效性。

技术框架:该方法包括触发器生成、毒药选择和攻击实施三个主要模块。触发器生成模块负责创建多样化的触发器,毒药选择模块则优化选择最有效的训练样本。

关键创新:LLMBkd的主要创新在于其自动化生成触发器的能力,显著提高了攻击的灵活性和成功率,与传统方法相比,减少了对人工设计的依赖。

关键设计:在设计中,采用了基于风格的触发器生成策略,并通过毒药选择技术来优化训练样本的选择,以提升攻击效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LLMBkd在多种文本风格下均能实现超过90%的攻击成功率,且在对比基线方法中表现出显著的提升,证明了其高效性和有效性。

🎯 应用场景

该研究的潜在应用领域包括文本分类系统的安全性评估、自然语言处理模型的鲁棒性测试以及对抗性机器学习的研究。随着文本分类在金融、社交媒体等领域的广泛应用,提升其安全性具有重要的实际价值和未来影响。

📄 摘要(原文)

Backdoor attacks manipulate model predictions by inserting innocuous triggers into training and test data. We focus on more realistic and more challenging clean-label attacks where the adversarial training examples are correctly labeled. Our attack, LLMBkd, leverages language models to automatically insert diverse style-based triggers into texts. We also propose a poison selection technique to improve the effectiveness of both LLMBkd as well as existing textual backdoor attacks. Lastly, we describe REACT, a baseline defense to mitigate backdoor attacks via antidote training examples. Our evaluations demonstrate LLMBkd's effectiveness and efficiency, where we consistently achieve high attack success rates across a wide range of styles with little effort and no model training.