Can LLMs Keep a Secret? Testing Privacy Implications of Language Models via Contextual Integrity Theory
作者: Niloofar Mireshghallah, Hyunwoo Kim, Xuhui Zhou, Yulia Tsvetkov, Maarten Sap, Reza Shokri, Yejin Choi
分类: cs.AI, cs.CL, cs.CR
发布日期: 2023-10-27 (更新: 2024-06-28)
备注: 2024 ICLR Spotlight. The dataset and code can be found at https://confaide.github.io
💡 一句话要点
提出ConfAIde基准以解决LLMs隐私推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 隐私保护 大型语言模型 上下文隐私 推理能力 ConfAIde基准 信息安全 AI助手
📋 核心要点
- 现有的LLMs在处理隐私信息时存在显著的推理不足,导致在不适当的上下文中泄露私人信息。
- 本文提出ConfAIde基准,旨在评估和识别LLMs在隐私推理方面的弱点,强调上下文隐私的重要性。
- 实验结果显示,GPT-4和ChatGPT在特定上下文中分别有39%和57%的概率泄露隐私信息,表明隐私保护的必要性。
📝 摘要(中文)
大型语言模型(LLMs)在交互式使用中引入了新的推理时隐私风险。本文关注上下文隐私的重要性,提出了ConfAIde基准,以识别指令调优LLMs在隐私推理能力上的关键弱点。实验表明,即使是最强大的模型如GPT-4和ChatGPT,在人类不会泄露隐私的上下文中,仍分别有39%和57%的概率泄露私人信息。这种泄露在使用隐私诱导提示或思维链推理时依然存在,强调了探索新型推理时隐私保护方法的迫切性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在推理过程中对隐私信息的处理不足,尤其是在上下文中不当泄露私人信息的问题。现有方法未能有效识别和保护隐私信息,导致用户信息安全隐患。
核心思路:论文提出ConfAIde基准,通过系统评估LLMs在隐私推理中的表现,强调上下文隐私的重要性。该方法通过设计特定的测试场景,揭示模型在隐私保护方面的不足。
技术框架:整体架构包括数据收集、模型评估和结果分析三个主要模块。首先,收集多种上下文信息并设计隐私泄露场景;其次,使用LLMs进行推理并记录输出;最后,分析模型在不同上下文中的隐私泄露情况。
关键创新:最重要的技术创新在于提出了ConfAIde基准,系统性地评估LLMs的隐私推理能力,与现有方法相比,提供了更为细致的上下文分析和评估标准。
关键设计:在实验中,使用了多种隐私诱导提示和思维链推理技术,尽管如此,仍发现模型在特定上下文中存在显著的隐私泄露风险。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GPT-4和ChatGPT在隐私推理方面的表现不佳,分别在39%和57%的情况下泄露私人信息。这一发现强调了当前LLMs在隐私保护方面的不足,并呼吁开发新的隐私保护方法。
🎯 应用场景
该研究的潜在应用领域包括智能助手、客户服务和任何涉及用户隐私的交互式AI系统。通过提升LLMs的隐私保护能力,可以增强用户信任,降低信息泄露风险,推动AI技术在敏感领域的应用。
📄 摘要(原文)
The interactive use of large language models (LLMs) in AI assistants (at work, home, etc.) introduces a new set of inference-time privacy risks: LLMs are fed different types of information from multiple sources in their inputs and are expected to reason about what to share in their outputs, for what purpose and with whom, within a given context. In this work, we draw attention to the highly critical yet overlooked notion of contextual privacy by proposing ConfAIde, a benchmark designed to identify critical weaknesses in the privacy reasoning capabilities of instruction-tuned LLMs. Our experiments show that even the most capable models such as GPT-4 and ChatGPT reveal private information in contexts that humans would not, 39% and 57% of the time, respectively. This leakage persists even when we employ privacy-inducing prompts or chain-of-thought reasoning. Our work underscores the immediate need to explore novel inference-time privacy-preserving approaches, based on reasoning and theory of mind.