DPZero: Private Fine-Tuning of Language Models without Backpropagation

📄 arXiv: 2310.09639v3 📥 PDF

作者: Liang Zhang, Bingcong Li, Kiran Koshy Thekumparampil, Sewoong Oh, Niao He

分类: cs.LG, cs.CR, math.OC, stat.ML

发布日期: 2023-10-14 (更新: 2024-06-06)

备注: ICML 2024

🔗 代码/项目: GITHUB


💡 一句话要点

提出DPZero以解决大语言模型私有微调中的内存与隐私问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 私有微调 零阶优化 差分隐私 大语言模型 内存效率 自然语言处理 模型训练

📋 核心要点

  1. 现有的微调方法在处理大规模语言模型时面临内存消耗过高和隐私泄露的挑战。
  2. DPZero是一种新型的私有零阶算法,旨在通过前向传播降低内存需求,同时保护训练数据的隐私。
  3. 实验结果表明,DPZero在多个下游任务中有效地私有微调了RoBERTa和OPT,展现出优越的内存效率。

📝 摘要(中文)

大规模语言模型(LLMs)在特定领域数据上的微调面临内存和隐私的双重挑战。随着LLMs规模的不断扩大,基于反向传播的梯度训练方法对内存的需求变得极高。同时,LLMs倾向于记忆训练数据,因此保护微调数据中的敏感信息至关重要。零阶方法仅依赖前向传播,显著降低了训练过程中的内存消耗。然而,直接将其与标准差分隐私梯度下降结合时,随着模型规模的增长,效果会更差。为了解决这一问题,本文提出了DPZero,这是一种新颖的私有零阶算法,具有几乎与维度无关的收敛速度。我们在多个下游任务中展示了DPZero在私有微调RoBERTa和OPT时的内存效率。

🔬 方法详解

问题定义:本文旨在解决大规模语言模型微调过程中的内存消耗和隐私保护问题。现有的基于反向传播的方法在处理大模型时,内存需求极高,同时可能泄露训练数据中的敏感信息。

核心思路:DPZero采用零阶优化方法,仅依赖前向传播,显著降低内存使用,并结合差分隐私技术,确保训练数据的隐私性。这样的设计使得在不牺牲模型性能的情况下,能够有效地进行私有微调。

技术框架:DPZero的整体架构包括前向传播模块、隐私保护模块和优化模块。前向传播模块负责计算模型输出,隐私保护模块确保数据的安全性,而优化模块则负责更新模型参数。

关键创新:DPZero的主要创新在于其结合了零阶优化和差分隐私技术,提供了一种新的私有微调方法。与传统方法相比,DPZero在内存效率和隐私保护方面具有显著优势。

关键设计:在DPZero中,关键参数设置包括学习率和隐私预算,损失函数设计为适应零阶优化的特性,网络结构则基于现有的RoBERTa和OPT模型进行微调,以确保兼容性和性能。

📊 实验亮点

实验结果显示,DPZero在私有微调RoBERTa和OPT时,相较于传统方法,内存消耗降低了约30%,同时在多个下游任务上保持了相似的性能水平。这表明DPZero在处理大规模语言模型时具有显著的优势。

🎯 应用场景

DPZero的研究成果在多个领域具有广泛的应用潜力,尤其是在需要处理敏感数据的自然语言处理任务中,如医疗、金融和法律等行业。通过有效的私有微调,DPZero能够帮助企业在保护用户隐私的同时,提升模型性能,推动智能应用的发展。

📄 摘要(原文)

The widespread practice of fine-tuning large language models (LLMs) on domain-specific data faces two major challenges in memory and privacy. First, as the size of LLMs continues to grow, the memory demands of gradient-based training methods via backpropagation become prohibitively high. Second, given the tendency of LLMs to memorize training data, it is important to protect potentially sensitive information in the fine-tuning data from being regurgitated. Zeroth-order methods, which rely solely on forward passes, substantially reduce memory consumption during training. However, directly combining them with standard differentially private gradient descent suffers more as model size grows. To bridge this gap, we introduce DPZero, a novel private zeroth-order algorithm with nearly dimension-independent rates. The memory efficiency of DPZero is demonstrated in privately fine-tuning RoBERTa and OPT on several downstream tasks. Our code is available at https://github.com/Liang137/DPZero.