Shadow Queries for Private Retrieval in Vector Databases

📄 arXiv: 2609.04767v1 📥 PDF

作者: Xinguo Feng, Zhongkui Ma, Zihan Wang, Chuan Yan, Guowei Yang, Alsharif Abuadbba, Guangdong Bai

分类: cs.AI

发布日期: 2026-09-04

备注: 13 pages


💡 一句话要点

提出SHAQ以解决向量数据库中的隐私检索问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 隐私保护 信息检索 嵌入反演攻击 生成语言模型 向量数据库 影子查询 语义分解 嵌入解耦

📋 核心要点

  1. 现有的嵌入防御方法在隐私保护和检索效用之间存在权衡,难以同时满足两者的需求。
  2. SHAQ通过生成多样化的影子查询,解耦文档嵌入与原始文本,从而增强隐私保护。
  3. 实验结果显示,SHAQ在隐私保护方面显著优于基线方法,同时保持或提升了检索效用。

📝 摘要(中文)

大型语言模型(LLMs)越来越依赖信息检索(IR)系统,如检索增强生成(RAG),以在不进行昂贵再训练的情况下融入领域特定知识。这些系统通常在云端向量数据库中存储预计算的文档嵌入。然而,这些嵌入易受到嵌入反演攻击(EIA),攻击者可以重构其底层文本。现有防御方法,如添加噪声或缩放嵌入,通常提供有限的隐私保护或显著降低检索效用。我们提出了SHAQ(影子查询生成),一种针对EIA的语义分解和嵌入解耦防御方法。SHAQ的核心在于EIA依赖于嵌入与其原始文本之间的强耦合。SHAQ使用生成语言模型创建多样化的影子查询,捕捉每个文档的不同语义方面,这些查询被编码并存储,取代原始文档嵌入,从而实现文档语义的分解和存储嵌入与源文本的解耦。实验结果表明,SHAQ在提高隐私的同时保持检索效用,恢复率低至0.2104,防御的令牌数量比基线防御提高了19.50%,MAP@10达到0.7967,效用提升高达5.53%。

🔬 方法详解

问题定义:本论文旨在解决向量数据库中嵌入反演攻击(EIA)带来的隐私泄露问题。现有方法如添加噪声或缩放嵌入,往往无法有效保护隐私,且可能降低检索效用。

核心思路:SHAQ的核心思路是通过生成影子查询来解耦文档的语义与其嵌入,避免直接存储原始文档嵌入,从而降低EIA的成功率。通过多样化的影子查询,捕捉文档的不同语义特征,增强隐私保护。

技术框架:SHAQ的整体架构包括三个主要模块:首先,使用生成语言模型生成多样化的影子查询;其次,对这些影子查询进行编码;最后,将编码后的查询存储在数据库中,替代原始文档嵌入。

关键创新:SHAQ的主要创新在于通过语义分解和嵌入解耦的方式,提供了一种新的防御机制,与传统的直接修改嵌入的方法本质上不同。

关键设计:在设计中,SHAQ使用了生成语言模型来确保影子查询的多样性,并通过特定的编码策略来优化存储效率,确保在提高隐私的同时,尽量保持检索效用。实验中还对参数设置进行了优化,以达到最佳效果。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,SHAQ在隐私保护方面显著优于基线方法,恢复率低至0.2104,防御的令牌数量比基线提高了19.50%。同时,MAP@10达到0.7967,效用提升高达5.53%,显示出其在保持检索效用的同时有效增强隐私保护的能力。

🎯 应用场景

该研究的潜在应用领域包括云计算环境中的数据隐私保护、智能搜索引擎以及任何需要在保护用户隐私的同时进行高效信息检索的场景。随着对隐私保护需求的增加,SHAQ的技术方案可能会在未来的检索系统中得到广泛应用,推动隐私保护技术的发展。

📄 摘要(原文)

Large language models (LLMs) increasingly rely on information retrieval (IR) systems, such as Retrieval-Augmented Generation (RAG), to incorporate domain-specific knowledge without costly re-training. These systems often store pre-computed document embeddings in cloud-based vector databases. However, such embeddings are vulnerable to embedding inversion attacks (EIAs), which can reconstruct their underlying text. Existing defenses, such as adding noise or scaling embeddings, often provide limited privacy or significantly reduce retrieval utility. We propose SHAQ (shadow query generation), a semantic-decomposition and embedding-decoupling defense against EIAs. SHAQ is based on the insight that EIAs rely on the strong coupling between an embedding and its original text. Instead of storing document embeddings directly, SHAQ uses a generative language model to create diverse shadow queries that capture different semantic aspects of each document. These queries are then encoded and stored in place of the original document embeddings, thereby decomposing document semantics and decoupling stored embeddings from the source text. Experiments across diverse IR datasets show that SHAQ substantially improves privacy while preserving retrieval utility, achieving a recovery rate as low as 0.2104, defending up to 19.50% more tokens than baseline defenses, and reaching up to 0.7967 MAP@10 with up to 5.53% utility improvement. These results demonstrate that semantic decomposition and embedding decoupling provide an effective alternative to directly modifying embeddings for defending against EIAs.