Sound Probabilistic Safety Bounds for Large Language Models
作者: Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate
分类: cs.CL, cs.AI
发布日期: 2026-07-22
备注: The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5
💡 一句话要点
提出一种新框架以计算大型语言模型的安全概率界限
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 安全性评估 概率界限 Clopper-Pearson置信区间 有害输出 潜在空间特征 自回归生成树
📋 核心要点
- 现有方法在评估大型语言模型生成有害输出的概率时缺乏严格的界限,导致安全性评估不够可靠。
- 论文提出了一种新算法,利用潜在空间特征优先探索可能产生有害输出的生成树分支,从而计算安全概率界限。
- 实验结果表明,该方法能够在真实危害概率极小的情况下,计算出有效的下界,提升了对LLM的安全性评估能力。
📝 摘要(中文)
本文提出了一种新颖的框架,用于计算大型语言模型(LLM)在给定提示下生成有害输出的概率界限。我们研究了Clopper-Pearson置信区间的新应用,以获得该问题的概率近似正确(PAC)界限。作为主要技术贡献,我们提出了一种算法,利用潜在空间中的特征来优先探索更可能产生有害输出的自回归生成树的分支。该方法特别能够高效计算有用的下界,即使在真实危害概率极小的情况下,获得的下界也是可靠的,经过形式证明小于实际的有害性概率。实验结果展示了我们的方法的有效性,能够在最先进的LLM上计算出非平凡的下界。这项研究新地实现了对LLM的评估和统计认证。
🔬 方法详解
问题定义:本文旨在解决大型语言模型生成有害输出的概率界限计算问题。现有方法缺乏严格的界限,导致安全性评估不够可靠。
核心思路:论文的核心思路是利用潜在空间中的特征,优先探索更可能产生有害输出的生成树分支,从而提高下界计算的效率和准确性。
技术框架:整体架构包括数据输入、潜在空间特征提取、生成树分支优先级计算、下界计算和结果输出等主要模块。
关键创新:最重要的技术创新点在于将Clopper-Pearson置信区间应用于LLM的有害输出概率界限计算,确保获得的下界是可靠的。与现有方法相比,本文方法在极小危害概率情况下仍能有效计算下界。
关键设计:在算法设计中,关键参数包括潜在空间特征的选择和生成树的分支优先级策略,损失函数设计用于优化下界的计算精度。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的方法在计算大型语言模型的有害输出概率下界方面表现优异,能够在真实危害概率极小的情况下,计算出有效的下界,显著提升了安全性评估的可靠性。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的安全性评估、风险管理和合规性检查。通过提供可靠的概率界限,能够帮助开发者和监管机构更好地理解和控制模型的输出风险,提升AI系统的安全性和可信度。
📄 摘要(原文)
We propose a novel framework for computing rigorous bounds on the probability that a large language model (LLM) generates harmful output to a given prompt. We study a new application of the Clopper-Pearson confidence intervals to obtain probably approximately correct (PAC) bounds for this problem. As our main technical contribution, we propose an algorithm that leverages features in the latent space to prioritize exploring branches in the auto-regressive generation tree that are more likely to produce harmful outputs. Our approach in particular enables the efficient computation of useful lower bounds, even in scenarios where the true harm probability is extremely small, and crucially, the obtained lower bounds are sound, i.e., formally proven to be less than the actual harmfulness probability: our experimental results demonstrate the effectiveness of our method by computing non-trivial lower bounds on state-of-the-art LLMs. This study newly enables the evaluation and statistical certification of LLMs.