Improving Few-shot Generalization of Safety Classifiers via Data Augmented Parameter-Efficient Fine-Tuning

📄 arXiv: 2310.16959v1 📥 PDF

作者: Ananth Balashankar, Xiao Ma, Aradhana Sinha, Ahmad Beirami, Yao Qin, Jilin Chen, Alex Beutel

分类: cs.LG

发布日期: 2023-10-25


💡 一句话要点

通过数据增强的参数高效微调提升安全分类器的少样本泛化能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 安全分类器 少样本学习 数据增强 参数高效微调 大型语言模型 文本安全 机器学习

📋 核心要点

  1. 现有的安全分类器在应对新出现的安全问题时泛化能力不足,尤其是在仅有少量违规示例的情况下。
  2. 论文提出结合相似示例进行数据增强与参数高效微调的策略,以提升分类器在新安全规则下的表现。
  3. 实验结果显示,所提方法在多个任务中均显著优于不使用数据增强或PEFT的基线,提升幅度明显。

📝 摘要(中文)

随着大型语言模型(LLMs)的广泛应用,新的安全问题和政策不断出现,现有的安全分类器在这些新问题上的泛化能力较差。本文研究了基于LLM的文本安全分类器在领域泛化少样本学习中的新设置。针对现有少样本技术在此情境下的不足,提出结合相似示例的数据增强与参数高效微调(PEFT)的方法。实验证明,基于相似性的数据增强与提示微调(DAPT)的方法在社会化化学道德判断和毒性检测任务中,F1分数提升了7-17%,AUC提升了9-13%,即使新规则与现有规则的相关性较低。

🔬 方法详解

问题定义:本文旨在解决在新安全规则下,现有安全分类器在少样本情况下的泛化能力不足的问题。现有方法在面对新出现的安全问题时,往往无法有效识别和分类。

核心思路:论文提出通过相似示例的数据增强与参数高效微调(PEFT)相结合的方法,以提高分类器在新规则下的性能。这种设计旨在利用已有的知识来增强模型的学习能力。

技术框架:整体方法包括两个主要模块:首先,通过分析已有规则生成相似示例进行数据增强;其次,应用参数高效微调技术对模型进行优化。这两个模块相辅相成,提升了模型的适应性。

关键创新:最重要的创新在于将数据增强与PEFT相结合,形成了一种新的训练策略。这与传统的少样本学习方法不同,后者通常依赖于固定的少量示例。

关键设计:在参数设置上,采用了适应性学习率和特定的损失函数,以确保模型在微调过程中能够有效学习新规则的特征。同时,网络结构上进行了适当的调整,以适应数据增强后的输入。

🖼️ 关键图片

img_0

📊 实验亮点

实验结果表明,所提的相似性基础数据增强与提示微调(DAPT)方法在社会化化学道德判断任务中,F1分数提升了7-17%;在毒性检测任务中,AUC提升了9-13%。这些结果显著优于不使用数据增强或PEFT的基线方法,验证了该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括内容审核、社交媒体监控和在线平台的安全性提升等。通过提高安全分类器的泛化能力,可以更有效地识别和处理新出现的违规内容,保障用户安全和平台合规。未来,该方法有望在更多领域推广应用,提升智能系统的安全性和可靠性。

📄 摘要(原文)

As large language models (LLMs) are widely adopted, new safety issues and policies emerge, to which existing safety classifiers do not generalize well. If we have only observed a few examples of violations of a new safety rule, how can we build a classifier to detect violations? In this paper, we study the novel setting of domain-generalized few-shot learning for LLM-based text safety classifiers. Unlike prior few-shot work, these new safety issues can be hard to uncover and we do not get to choose the few examples. We demonstrate that existing few-shot techniques do not perform well in this setting, and rather we propose to do parameter-efficient fine-tuning (PEFT) combined with augmenting training data based on similar examples in prior existing rules. We empirically show that our approach of similarity-based data-augmentation + prompt-tuning (DAPT) consistently outperforms baselines that either do not rely on data augmentation or on PEFT by 7-17% F1 score in the Social Chemistry moral judgement and 9-13% AUC in the Toxicity detection tasks, even when the new rule is loosely correlated with existing ones.