MoPe: Model Perturbation-based Privacy Attacks on Language Models
作者: Marvin Li, Jason Wang, Jeffrey Wang, Seth Neel
分类: cs.LG, cs.AI
发布日期: 2023-10-22
💡 一句话要点
提出MoPe方法以识别语言模型训练数据中的敏感信息
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 语言模型 隐私攻击 模型扰动 对数似然 Hessian矩阵 数据泄露 安全性评估
📋 核心要点
- 现有方法在识别语言模型训练数据中的敏感信息时存在不足,尤其是依赖单一损失值来判断记忆或遗忘的有效性。
- 本文提出的MoPe方法通过在参数空间中引入噪声,测量对数似然的变化,从而高效识别训练数据中的文本。
- 实验结果表明,MoPe在不同规模的语言模型上均表现出色,超越了现有的攻击方法,且能够准确近似Hessian矩阵的迹。
📝 摘要(中文)
近年来的研究表明,大型语言模型(LLMs)可能会无意中泄露其训练数据中的敏感信息。本文提出了一种新的方法——模型扰动(MoPe),用于高效识别给定文本是否存在于预训练语言模型的训练数据中,前提是对模型参数具有白盒访问权限。MoPe通过在参数空间中添加噪声并测量给定点$x$的对数似然下降,来近似Hessian矩阵的迹。我们在参数范围从7000万到120亿的语言模型上展示了MoPe的有效性,超越了现有的基于损失的攻击和新近提出的扰动方法。我们还考察了训练点顺序和模型规模对攻击成功率的影响,并实证证明MoPe在实践中能够准确近似Hessian的迹。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在训练过程中可能泄露敏感信息的问题。现有方法多依赖于单一的损失值来判断模型是否记忆了特定训练点,这种方法存在局限性,无法全面反映模型的记忆能力。
核心思路:MoPe方法的核心思路是通过在模型参数空间中引入扰动,观察对数似然的变化,从而判断特定文本是否存在于训练数据中。这种设计能够更全面地捕捉模型对训练数据的敏感性。
技术框架:MoPe的整体架构包括三个主要模块:首先是参数扰动模块,通过添加噪声来改变模型参数;其次是对数似然计算模块,测量扰动前后模型对特定文本的对数似然;最后是Hessian迹近似模块,利用对数似然的变化来近似Hessian矩阵的迹。
关键创新:MoPe的主要创新在于其通过参数扰动来评估模型对训练数据的敏感性,这与传统方法依赖损失值的方式截然不同。通过这种方式,MoPe能够更准确地识别训练数据中的敏感信息。
关键设计:在MoPe中,关键的参数设置包括扰动的幅度和噪声的类型。此外,损失函数的选择也对模型的表现有重要影响,本文通过实验验证了不同设置对攻击效果的影响。具体的网络结构与现有语言模型相同,但通过扰动引入了新的动态特性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MoPe在70M到12B参数的语言模型上均表现优异,相较于现有的损失基攻击和扰动方法,MoPe的有效性显著提升。具体而言,MoPe能够准确识别出一些平均损失的训练点,挑战了以往研究对记忆和遗忘的传统看法。
🎯 应用场景
该研究的潜在应用领域包括数据隐私保护、模型安全性评估以及对抗性攻击研究。通过识别模型训练数据中的敏感信息,MoPe可以帮助开发更安全的语言模型,减少信息泄露的风险。此外,该方法也可用于评估现有模型的隐私保护能力,推动相关领域的研究进展。
📄 摘要(原文)
Recent work has shown that Large Language Models (LLMs) can unintentionally leak sensitive information present in their training data. In this paper, we present Model Perturbations (MoPe), a new method to identify with high confidence if a given text is in the training data of a pre-trained language model, given white-box access to the models parameters. MoPe adds noise to the model in parameter space and measures the drop in log-likelihood at a given point $x$, a statistic we show approximates the trace of the Hessian matrix with respect to model parameters. Across language models ranging from $70$M to $12$B parameters, we show that MoPe is more effective than existing loss-based attacks and recently proposed perturbation-based methods. We also examine the role of training point order and model size in attack success, and empirically demonstrate that MoPe accurately approximate the trace of the Hessian in practice. Our results show that the loss of a point alone is insufficient to determine extractability -- there are training points we can recover using our method that have average loss. This casts some doubt on prior works that use the loss of a point as evidence of memorization or unlearning.