Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents

📄 arXiv: 2607.15263v1 📥 PDF

作者: Paul Kassianik, Blaine Nelson, Yaron Singer

分类: cs.CR, cs.AI

发布日期: 2026-07-16


💡 一句话要点

提出成本感知评估方法以优化安全代理的性能

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)

关键词: 安全代理 成本感知评估 网络安全 攻击性任务 防御性任务 模型性能比较 经济效率 操作适应性

📋 核心要点

  1. 现有的安全代理评估方法主要关注攻击能力,忽视了实际操作中的成本因素,导致评估结果不够全面。
  2. 本文提出了一种新的评估框架,通过固定成本水平比较模型性能,强调推理和工具支出的影响。
  3. 实验结果表明,攻击性任务的性能随着计算资源的增加而提升,而防御性任务则更依赖于工具的有效使用和策略性增强。

📝 摘要(中文)

安全代理的评估通常侧重于在宽松的推理预算下测量其最高攻击能力,强调漏洞发现、利用开发、渗透测试和CTF完成等方面。然而,这种评估方法在实际操作中并不全面,因为每一步推理、工具调用、遥测查询和增强请求都消耗预算。本文通过成本-成功的视角评估语言模型安全代理在攻击性Cybench挑战和防御性Splunk BOTS v1调查挑战中的表现。我们不仅报告最佳成功案例,还在固定成本水平下比较模型,并根据推理支出和工具支出分解性能。结果显示红队和蓝队任务的不同扩展机制,攻击性CTF性能随着测试时间计算的增加而改善,而防御性SOC调查的成功更依赖于工具使用的规范性、遥测导航和选择性增强。我们认为安全代理基准应同时测量经济效率和操作适应性。

🔬 方法详解

问题定义:本文旨在解决现有安全代理评估方法过于关注成功率而忽视成本的问题。现有方法在实际操作中无法反映每一步推理和工具调用的经济影响。

核心思路:论文提出了一种成本感知的评估方法,通过在固定成本下比较模型性能,提供更全面的安全代理评估视角。这样的设计能够更好地反映模型在实际应用中的经济效率和操作适应性。

技术框架:整体架构包括两个主要模块:攻击性Cybench挑战和防御性Splunk BOTS v1调查挑战。评估过程中,模型在固定预算下进行测试,记录推理支出和工具支出。

关键创新:最重要的创新在于引入了成本感知的评估标准,强调了经济效率与操作适应性的结合。这与传统方法的单一成功率评估形成了鲜明对比。

关键设计:在评估过程中,设置了固定的推理预算,并对不同模型的推理支出和工具支出进行了详细记录和分析,以确保评估结果的准确性和可比性。具体的参数设置和损失函数设计未在摘要中详细说明,需参考原文获取更多信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,攻击性CTF任务的性能随着计算资源的增加而显著提升,开放权重模型在成本竞争力上接近前沿的专有系统。而防御性SOC调查的成功则更依赖于工具使用的规范性,强调了不同任务的评估标准差异。

🎯 应用场景

该研究的潜在应用领域包括网络安全、渗透测试和安全代理开发等。通过提供更全面的评估方法,能够帮助安全团队选择更具经济效益的模型,从而提升整体安全防护能力。未来,该方法有望推动安全代理的标准化评估,促进行业内的技术进步。

📄 摘要(原文)

Security-agent evaluations commonly measure peak offensive capability under generous inference budgets, emphasizing vulnerability discovery, exploit development, penetration testing, and CTF completion. Such measurements are useful but incomplete: in operational security, every reasoning step, tool call, telemetry query, and enrichment request consumes budget. We evaluate language-model security agents through this cost-success lens on offensive Cybench challenges and defensive Splunk BOTS v1 investigation challenges. Instead of reporting only best-case success, we compare models at fixed cost levels and decompose performance by inference spend and tool spend. Our results show distinct scalingregimes for red- and blue-team tasks. Offensive CTF performance improves with additional test-time compute, and scaled open-weight models can approach frontier proprietary systems while remaining cost-competitive. Defensive SOC investigation does not scale in the same way: success depends more heavily on disciplined tool use, telemetry navigation, and selective enrichment than on raw reasoning budget alone. We argue that security-agent benchmarks should measure economic efficiency and operational fit alongside task success. Cost-aware, SOC-native evaluations provide a clearer picture of which models are practically useful today and where defensive agents still need to improve. We present an interactive website with our results https://evals.frontier.security.