Multi-Agent Firewall Architecture for Privacy Protection of Sensitive Data in Interactions with Language Models

📄 arXiv: 2607.08282v1 📥 PDF

作者: Hugo García Cuesta, Pablo Mateo Torrejón, Alfonso Sánchez-Macián

分类: cs.CR, cs.AI, cs.MA

发布日期: 2026-07-09


💡 一句话要点

提出多代理防火墙架构以保护与语言模型交互中的隐私数据

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 隐私保护 多代理系统 数据泄露防护 大型语言模型 安全架构

📋 核心要点

  1. 现有方法在与大型语言模型交互时缺乏有效的隐私保护措施,导致敏感数据泄露风险增加。
  2. 本文提出了一种多代理防火墙架构,结合浏览器扩展和代理,能够全面拦截和分析数据流,确保隐私安全。
  3. 实验结果表明,该框架在最佳配置下实现了高达94.93%的F1得分,显示出其在数据泄露防护方面的有效性。

📝 摘要(中文)

随着大型语言模型(LLMs)成为重要的生产力工具,其在工作流程中的集成若没有适当的保护措施,会带来显著风险。本文提出了一种开源的、以隐私为中心的用户防火墙,旨在保护基于Web和程序化的LLM交互。该架构结合了浏览器扩展和代理,能够全面拦截HTTP(S)和WebSocket通信的流量。其核心是一个灵活的多代理管道,通过结合确定性检测器与LLM驱动的语义分析,提供数据泄露防护,并设计了可扩展的组件以支持未来的安全增强,如提示注入规避。该框架的分层架构使其能够在异构环境中部署,帮助组织在计算成本、检测深度和延迟之间取得平衡。评估结果显示,在最佳配置下,其F1得分高达94.93%。

🔬 方法详解

问题定义:本文旨在解决在与大型语言模型交互时,用户隐私数据泄露的风险。现有方法缺乏有效的保护机制,容易导致敏感信息被泄露。

核心思路:论文提出的防火墙架构通过结合多代理技术和语义分析,能够实时拦截和分析数据流,从而有效防止数据泄露。这样的设计使得防护措施更加灵活和智能。

技术框架:整体架构包括浏览器扩展和代理服务器,能够全面拦截HTTP(S)和WebSocket通信。核心模块为多代理管道,负责数据分析和泄露检测。

关键创新:最重要的创新在于结合了确定性检测器与LLM驱动的语义分析,形成混合防护机制。这种方法与传统的单一检测方式有本质区别,能够更全面地识别潜在的泄露风险。

关键设计:在参数设置上,系统允许根据不同环境调整检测深度与延迟,优化计算成本。此外,设计了可扩展的组件,以便未来能够集成更多的安全增强功能,如提示注入规避。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,在最佳配置下,该防火墙架构的F1得分高达94.93%,显著优于现有的隐私保护方法。这表明其在数据泄露防护方面具有很高的有效性和可靠性,为用户提供了更强的隐私保障。

🎯 应用场景

该研究的潜在应用领域包括企业数据保护、个人隐私安全以及任何需要与大型语言模型交互的场景。通过有效防护用户数据,该防火墙架构能够提升用户对AI工具的信任,促进其在各行业的广泛应用。未来,该技术还可以扩展到更多的安全防护需求中,进一步增强数据安全性。

📄 摘要(原文)

While Large Language Models (LLMs) have become essential productivity tools, their integration into workflows without adequate safeguards creates significant risks. This paper proposes an open-source, privacy-focused, user-facing firewall designed to secure both web-based and programmatic LLM interactions. The architecture combines a browser extension and a proxy for total traffic interception across both HTTP(S) and WebSocket communications. At its core, a flexible multi-agent pipeline delivers data leakage prevention through a hybrid approach combining deterministic detectors with LLM-driven semantic analysis, proprietary code leakage prevention, and extensible components designed for future security enhancements such as prompt injection evasion. The framework's layered architecture enables deployment across heterogeneous environments, allowing organizations to balance computational cost, detection depth and latency. Evaluation results demonstrate it achieves F1 scores of up to 94.93% on optimal configurations.