GuardianAgentBench: Where Agents Fail and How to Guard Them
作者: Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad
分类: cs.AI
发布日期: 2026-07-23
💡 一句话要点
提出GuardianAgentBench以解决语言模型代理的安全性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 语言模型 安全性 基准测试 对抗攻击 工具调用 结构干预 智能代理 性能评估
📋 核心要点
- 现有大型语言模型代理在自主操作时存在安全性和可靠性不足的问题,尤其是在工具调用方面。
- 论文提出了GuardianAgentBench基准,通过580个场景和多种对抗攻击模式来评估代理的表现,旨在提高其安全性。
- 实验结果表明,强模型的准确率仅为74.8%,而护栏实现能在低假阳性率下显著恢复失败,展示了有效的安全干预策略。
📝 摘要(中文)
随着大型语言模型代理越来越多地自主操作并访问工具和外部环境,确保其安全和可靠的行为变得至关重要。本文提出了GuardianAgentBench(GABench),这是一个涵盖580个场景的基准测试,涉及六个领域,并在三个生产就绪的框架上进行评估:LangChain、LlamaIndex和Vectara。该基准测试结合了严格的多阶段验证和五种对抗攻击模式。实验结果显示,即使是最强的配置,其整体准确率也仅为74.8%,并揭示了两种不同的失败模式:强模型在调用所需工具时不足,而弱模型则错误选择和过度调用工具。性能随着工具集大小和序列回合深度的增加而单调下降,长远规划被证明是更大的瓶颈。我们的护栏实现始终优于基于系统提示的防御措施,在所有模型中以仅0.5%的假阳性率恢复了19.9%的失败。这些结果表明,执行时的结构干预在不干扰正确代理行为的情况下提高了安全性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型代理在自主操作中可能出现的安全性和可靠性问题,尤其是在工具调用的准确性方面。现有方法在面对复杂场景时表现不佳,导致代理行为不稳定。
核心思路:论文的核心思路是通过构建GuardianAgentBench基准,系统性地评估代理在多种场景下的表现,并引入护栏机制来提升安全性。设计上,护栏机制旨在实时干预代理的决策过程,以减少错误调用和过度调用工具的情况。
技术框架:整体架构包括场景生成、模型评估和护栏实施三个主要模块。首先生成580个多样化的场景,然后在LangChain、LlamaIndex和Vectara等框架上评估代理表现,最后实施护栏机制以提高安全性。
关键创新:最重要的技术创新在于引入了护栏机制,该机制在执行时进行结构性干预,显著改善了代理的安全性和可靠性。这与现有的基于系统提示的防御措施本质上不同,后者往往无法有效应对复杂的场景。
关键设计:在实验中,护栏机制的设计考虑了假阳性率和恢复失败的能力,设置了0.5%的假阳性率目标,并在此基础上实现了19.9%的失败恢复率。
🖼️ 关键图片
📊 实验亮点
实验结果显示,最强模型的整体准确率仅为74.8%,而护栏机制在所有模型中以0.5%的假阳性率恢复了19.9%的失败,显著优于传统的基于系统提示的防御措施。这表明执行时的结构干预在提升安全性方面具有重要作用。
🎯 应用场景
该研究的潜在应用领域包括自动化客服、智能助手和其他需要自主决策的语言模型代理。通过提高代理的安全性和可靠性,可以在更广泛的实际场景中部署这些技术,减少潜在的风险和错误。未来,这种方法可能会影响智能系统的设计和评估标准,推动更安全的人工智能应用。
📄 摘要(原文)
As large language model agents increasingly operate autonomously with access to tools and external environments, ensuring their safe and reliable behavior becomes critical. We present GuardianAgentBench (GABench), a benchmark of 580 scenarios across six domains evaluated on three production-ready frameworks: LangChain, LlamaIndex, and Vectara. The benchmark incorporates rigorous multi-stage validation and five adversarial attack modes. Experiments with six state-of-the-art models reveal that even the strongest configuration achieves only 74.8% overall accuracy and expose two distinct failure regimes: stronger models under-call required tools, while weaker models mis-select and over-call tools. Performance degrades monotonically with both tool-set size and sequential turn depth, with long-horizon planning proving the steeper bottleneck. Our guardrail implementation consistently outperforms system-prompt-based defenses across all models, recovering 19.9% of failures at a false positive rate of just 0.5%. These results demonstrate that execution-time structural intervention improves safety without disrupting correct agent behavior.