Locally Differentially Private Document Generation Using Zero Shot Prompting

📄 arXiv: 2310.16111v2 📥 PDF

作者: Saiteja Utpala, Sara Hooker, Pin Yu Chen

分类: cs.CL, cs.CR, cs.LG

发布日期: 2023-10-24 (更新: 2023-11-30)

备注: Accepted at EMNLP 2023 (Findings)


💡 一句话要点

提出DP-Prompt机制以解决大语言模型隐私保护问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 局部差分隐私 文本生成 去匿名化攻击 大型语言模型 隐私保护 零-shot提示

📋 核心要点

  1. 现有的预训练大型语言模型在隐私保护方面存在显著风险,容易受到去匿名化攻击。
  2. 论文提出DP-Prompt机制,结合预训练语言模型和零-shot提示,旨在增强隐私保护能力。
  3. 实验结果显示,DP-Prompt在IMDB数据集上有效降低了作者识别率,同时保持了情感分析的性能。

📝 摘要(中文)

众多研究强调了预训练的大型语言模型所带来的隐私风险。与此相对,我们的研究展示了预训练的大型语言模型在隐私保护方面的有效性。我们提出了一种名为DP-Prompt的局部差分隐私机制,利用预训练的大型语言模型和零-shot提示,抵御作者去匿名化攻击,同时尽量减少对下游效用的影响。当DP-Prompt与强大的语言模型如ChatGPT(gpt-3.5)结合使用时,我们观察到去匿名化攻击的成功率显著降低,且其设计相对简单,超越了现有方法。例如,在IMDB数据集上,DP-Prompt(与ChatGPT结合)完美恢复了干净的情感F1分数,同时在静态攻击者面前实现了46%的作者识别F1分数降低,适应性攻击者则降低了26%。我们在六个开源大型语言模型上进行了广泛实验,分析隐私与效用之间的权衡。

🔬 方法详解

问题定义:本论文旨在解决预训练大型语言模型在隐私保护方面的不足,尤其是其易受到去匿名化攻击的问题。现有方法往往在保护隐私的同时损害了模型的下游效用。

核心思路:DP-Prompt机制通过结合局部差分隐私和零-shot提示,旨在在不显著降低模型性能的情况下,增强对去匿名化攻击的抵抗力。这样的设计使得模型在生成文本时能够有效保护作者身份。

技术框架:DP-Prompt的整体架构包括数据输入、预训练语言模型的调用、隐私保护机制的应用以及最终的文本生成。主要模块包括输入处理、隐私保护层和输出生成层。

关键创新:DP-Prompt的核心创新在于其简单而有效的设计,能够在保持生成文本质量的同时,显著降低去匿名化攻击的成功率。这与现有复杂的隐私保护方法形成鲜明对比。

关键设计:在DP-Prompt中,关键参数设置包括隐私预算的选择和模型的微调策略。损失函数设计上,注重平衡隐私保护与生成质量,确保在不同攻击场景下的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,DP-Prompt在IMDB数据集上实现了46%的作者识别F1分数降低,适应性攻击者则降低了26%。同时,DP-Prompt与ChatGPT结合使用时,完美恢复了情感分析的F1分数,显示出其在隐私保护与效用之间的优越平衡。

🎯 应用场景

该研究的潜在应用领域包括社交媒体、在线评论和任何需要保护用户隐私的文本生成场景。通过提升大型语言模型的隐私保护能力,DP-Prompt能够在确保用户身份安全的同时,继续提供高质量的文本生成服务,具有重要的实际价值和未来影响。

📄 摘要(原文)

Numerous studies have highlighted the privacy risks associated with pretrained large language models. In contrast, our research offers a unique perspective by demonstrating that pretrained large language models can effectively contribute to privacy preservation. We propose a locally differentially private mechanism called DP-Prompt, which leverages the power of pretrained large language models and zero-shot prompting to counter author de-anonymization attacks while minimizing the impact on downstream utility. When DP-Prompt is used with a powerful language model like ChatGPT (gpt-3.5), we observe a notable reduction in the success rate of de-anonymization attacks, showing that it surpasses existing approaches by a considerable margin despite its simpler design. For instance, in the case of the IMDB dataset, DP-Prompt (with ChatGPT) perfectly recovers the clean sentiment F1 score while achieving a 46\% reduction in author identification F1 score against static attackers and a 26\% reduction against adaptive attackers. We conduct extensive experiments across six open-source large language models, ranging up to 7 billion parameters, to analyze various effects of the privacy-utility tradeoff.