Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
作者: Paul Kassianik, Blaine Nelson, Yaron Singer
分类: cs.CR, cs.AI
发布日期: 2026-07-20
💡 一句话要点
提出成本感知评估方法以优化安全代理的性能
🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)
关键词: 安全代理 成本感知 性能评估 网络安全 渗透测试 经济效率 工具使用 推理预算
📋 核心要点
- 现有安全代理评估方法主要关注攻击能力,忽视了实际操作中的成本因素,导致评估结果不够全面。
- 本文提出了一种成本感知的评估方法,通过固定成本水平比较模型性能,强调推理支出和工具支出的分解。
- 实验结果表明,进攻性任务的性能随着计算资源的增加而提升,而防御性任务则更依赖于工具的有效使用和策略性操作。
📝 摘要(中文)
安全代理的评估通常侧重于在宽松的推理预算下测量其最高攻击能力,强调漏洞发现、利用开发、渗透测试和CTF完成等方面。然而,这种评估方法并不全面,因为在实际操作中,每一步推理、工具调用、遥测查询和增强请求都会消耗预算。本文通过成本-成功的视角评估语言模型安全代理在进攻性Cybench挑战和防御性Splunk BOTS v1调查挑战中的表现。我们不仅报告最佳成功案例,还在固定成本水平下比较模型,并分解推理支出和工具支出。结果显示红队和蓝队任务的不同扩展模式,进攻性CTF性能随着测试时间计算的增加而改善,而防御性SOC调查的成功更依赖于工具的规范使用、遥测导航和选择性增强,而非单纯的推理预算。我们认为安全代理基准应同时测量经济效率和操作适应性。
🔬 方法详解
问题定义:本文旨在解决现有安全代理评估方法过于关注成功率而忽视成本效益的问题。现有方法未能全面反映安全代理在实际操作中的经济效率和适用性。
核心思路:论文提出了一种新的评估框架,通过在固定成本水平下比较模型性能,分析推理和工具支出的影响,从而提供更全面的性能评估。
技术框架:整体架构包括两个主要模块:进攻性Cybench挑战和防御性Splunk BOTS v1调查挑战。每个模块通过固定的预算进行评估,分别分析推理支出和工具支出对性能的影响。
关键创新:最重要的创新在于引入了成本感知的评估方法,强调了经济效率在安全代理评估中的重要性。这与传统方法的单一成功率评估形成了鲜明对比。
关键设计:在实验中,设置了固定的推理预算,并通过不同的工具使用策略进行对比。损失函数设计上考虑了成功率与成本之间的权衡,确保评估结果的经济合理性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,进攻性CTF任务的性能随着计算资源的增加而显著提升,开放权重模型在成本竞争上接近前沿的专有系统。而防御性SOC调查的成功率则更依赖于工具的有效使用,强调了操作策略的重要性。
🎯 应用场景
该研究的潜在应用领域包括网络安全、渗透测试和安全运营中心(SOC)等。通过提供更具成本效益的安全代理评估方法,能够帮助企业在资源有限的情况下优化安全策略,提高防御能力和响应效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Security-agent evaluations commonly measure peak offensive capability under generous inference budgets, emphasizing vulnerability discovery, exploit development, penetration testing, and CTF completion. Such measurements are useful but incomplete: in operational security, every reasoning step, tool call, telemetry query, and enrichment request consumes budget. We evaluate language-model security agents through this cost-success lens on offensive Cybench challenges and defensive Splunk BOTS v1 investigation challenges. Instead of reporting only best-case success, we compare models at fixed cost levels and decompose performance by inference spend and tool spend. Our results show distinct scalingregimes for red- and blue-team tasks. Offensive CTF performance improves with additional test-time compute, and scaled open-weight models can approach frontier proprietary systems while remaining cost-competitive. Defensive SOC investigation does not scale in the same way: success depends more heavily on disciplined tool use, telemetry navigation, and selective enrichment than on raw reasoning budget alone. We argue that security-agent benchmarks should measure economic efficiency and operational fit alongside task success. Cost-aware, SOC-native evaluations provide a clearer picture of which models are practically useful today and where defensive agents still need to improve. We present an interactive website with our resultsthis https URL.