LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B
作者: Simon Lermen, Charlie Rogers-Smith, Jeffrey Ladish
分类: cs.LG, cs.AI
发布日期: 2023-10-31 (更新: 2024-05-22)
💡 一句话要点
提出LoRA微调方法以有效解除Llama 2-Chat的安全训练
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 安全训练 微调方法 量化低秩适应 语言模型 风险评估 AI安全 模型滥用
📋 核心要点
- 现有的安全训练方法在防止AI系统被滥用方面存在一定的脆弱性,可能被反向微调所破解。
- 本文提出了一种基于LoRA的高效微调方法,旨在有效解除Llama 2-Chat模型的安全训练。
- 实验结果显示,70B Llama 2-Chat模型在两个拒绝基准上的拒绝率降至约1%,同时保持了良好的通用性能。
📝 摘要(中文)
AI开发者通常会应用安全对齐程序以防止其AI系统的误用。例如,在Meta发布Llama 2-Chat之前,他们在安全训练上投入了大量资源,包括广泛的红队测试和人类反馈的强化学习。本文探讨了语言模型安全训练的稳健性,通过反向微调Llama 2-Chat,采用量化低秩适应(LoRA)作为高效的微调方法。在不到200美元的预算和仅使用一台GPU的情况下,我们成功解除Llama 2-Chat模型(包括7B、13B和70B)的安全训练,显著降低了模型拒绝执行有害指令的比率。我们在两个拒绝基准上实现了70B Llama 2-Chat模型约1%的拒绝率,同时在两个通用性能基准上保持了能力。我们认为,反向微调是切实可行且有效的,因此评估微调带来的风险应成为发布模型权重风险评估的核心部分。
🔬 方法详解
问题定义:本文旨在解决Llama 2-Chat模型的安全训练被反向微调解除的问题。现有的安全训练方法在面对恶意微调时表现出脆弱性,可能导致模型的安全性下降。
核心思路:论文提出通过量化低秩适应(LoRA)技术进行高效微调,以反向解除模型的安全训练。LoRA方法通过减少参数量和计算复杂度,使得微调过程更加经济和高效。
技术框架:整体架构包括数据准备、LoRA微调和性能评估三个主要模块。首先,准备包含有害指令的数据集,然后应用LoRA进行微调,最后通过拒绝基准和通用性能基准进行评估。
关键创新:最重要的技术创新在于使用LoRA方法进行反向微调,显著降低了模型拒绝有害指令的比率。与传统的微调方法相比,LoRA在资源消耗和效果上都表现出更高的效率。
关键设计:在微调过程中,关键参数设置包括低秩矩阵的维度和学习率的选择。损失函数采用了适应性调整,以确保模型在微调后仍能保持良好的性能。
📊 实验亮点
实验结果显示,70B Llama 2-Chat模型在两个拒绝基准上的拒绝率降至约1%,这一结果显著低于未微调模型的拒绝率。同时,模型在通用性能基准上保持了良好的表现,证明了反向微调的有效性。
🎯 应用场景
该研究的潜在应用领域包括AI模型的安全性评估和风险管理,尤其是在发布大型语言模型时。通过理解微调对安全性的影响,开发者可以更好地设计安全对齐机制,降低模型被滥用的风险。未来,这一研究可能推动更安全的AI系统的开发与应用。
📄 摘要(原文)
AI developers often apply safety alignment procedures to prevent the misuse of their AI systems. For example, before Meta released Llama 2-Chat - a collection of instruction fine-tuned large language models - they invested heavily in safety training, incorporating extensive red-teaming and reinforcement learning from human feedback. We explore the robustness of safety training in language models by subversively fine-tuning Llama 2-Chat. We employ quantized low-rank adaptation (LoRA) as an efficient fine-tuning method. With a budget of less than \$200 and using only one GPU, we successfully undo the safety training of Llama 2-Chat models of sizes 7B, 13B, and 70B and on the Mixtral instruct model. Specifically, our fine-tuning technique significantly reduces the rate at which the model refuses to follow harmful instructions. We achieve refusal rates of about 1\% for our 70B Llama 2-Chat model on two refusal benchmarks. Simultaneously, our method retains capabilities across two general performance benchmarks. We show that subversive fine-tuning is practical and effective, and hence argue that evaluating risks from fine-tuning should be a core part of risk assessments for releasing model weights. While there is considerable uncertainty about the scope of risks from current models, future models will have significantly more dangerous capabilities.