When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

📄 arXiv: 2607.24392v1 📥 PDF

作者: Tong Zhang, Zexin Li, Simin Chen, Yun Peng

分类: cs.CR, cs.LG

发布日期: 2026-07-27


💡 一句话要点

系统研究LLM防御的安全性、性能与成本权衡

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 安全防御 性能评估 推理成本 操作策略

📋 核心要点

  1. 现有的LLM防御方法在提升安全性的同时,往往会引入性能下降和效率降低的问题。
  2. 论文通过系统研究不同防御策略的副作用,提出了按操作策略分类的防御方法分析框架。
  3. 实验结果表明,基于规则的防御在保持任务性能方面表现最佳,而多轮防御则导致显著的运行时开销。

📝 摘要(中文)

监狱破解防御对于保护大型语言模型(LLMs)至关重要,但也可能引入削弱模型效用的次级成本。我们对这些防御的权衡进行了系统研究,涵盖性能影响、对良性输入的过度拒绝和推理成本三个维度。我们将防御方法按操作策略进行分类,探讨不同策略与副作用特征之间的相关性。研究发现,防御方法通常不会提升下游能力,而是在安全性与可用性、效率之间进行权衡。特别是,基于规则的防御最能保持任务性能,而高度保守的自反防御往往增加过度拒绝,多轮防御则带来最大的运行时开销。这些结果为评估防御副作用提供了基准,并为在部署约束下选择防御提供了实用指导。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型(LLMs)在安全防御中引入的性能与效率问题。现有方法往往未能平衡安全性与可用性,导致模型效用下降。

核心思路:论文提出了一种系统化的防御策略分类方法,通过分析不同策略的副作用,帮助研究者理解防御的权衡关系,从而优化防御选择。

技术框架:研究首先对现有防御方法进行分类,随后通过实验评估不同防御策略在性能、过度拒绝和推理成本上的表现,最后提供实用的选择指导。

关键创新:最重要的创新在于将防御方法按操作策略进行系统分类,并揭示了不同策略在安全性与可用性之间的权衡关系,这一视角在现有文献中较为少见。

关键设计:论文中使用了多种基准数据集和开源LLM进行实验,重点考察了规则基础防御、自反防御和多轮防御的性能表现和运行时开销。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,基于规则的防御方法在任务性能保持上优于其他策略,而多轮防御则导致了显著的运行时开销,增加了系统的整体成本。这些发现为防御策略的选择提供了重要的实证依据。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和智能助手等,能够为开发安全且高效的LLM提供理论支持和实践指导。通过优化防御策略,开发者可以在确保模型安全的同时,最大限度地提升模型的实用性和效率。

📄 摘要(原文)

Jailbreak defenses are essential for protecting large language models (LLMs), but they can also introduce secondary costs that weaken model utility. We present a systematic study of these defense trade-offs along three dimensions: performance impact, over-refusal on benign inputs, and inference cost. Rather than treating defenses as a single class, we organize them by operational strategy and examine how different strategies correlate with different side-effect profiles. Across state-of-the-art defense methods, widely used benchmark datasets, and representative open-source LLMs, we find that defenses rarely improve downstream capability, but instead vary in how they trade safety gains against usability and efficiency. In particular, rule-based defenses best preserve task performance, highly conservative self-reflective defenses often increase over-refusal, and multi-round defenses incur the largest runtime overhead. These results provide both a benchmark for evaluating defense side effects and practical guidance for selecting defenses under deployment constraints.