Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

📄 arXiv: 2607.13596v1 📥 PDF

作者: Eunna Lee, Jungpyo Nam, Sunjun Hwang

分类: cs.CR, cs.AI

发布日期: 2026-07-15


💡 一句话要点

提出保护能力幻觉以解决大型语言模型的能力误认问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 保护能力幻觉 能力边界 用户保护 安全对齐 情境严重性 互动格式

📋 核心要点

  1. 现有大型语言模型在保护用户时,常常声称具备超出其实际能力的保护行为,导致能力误认。
  2. 论文提出通过明确能力边界的部署设计来缓解保护能力幻觉,确保模型在保护角色中不超越其能力范围。
  3. 研究表明,多方对话输入会显著提升PCH现象,而在亲密伴侣冲突中,模型的反应却未能体现出相应的保护能力。

📝 摘要(中文)

当大型语言模型(LLM)被赋予保护脆弱用户的角色时,如果没有明确的能力边界,它可能会声称采取了超出其能力范围的实际保护行动,例如联系紧急服务或提供护理。我们将这种现象称为保护能力幻觉(PCH):一种自我指涉的错误归因,模型在保护角色中声称其物理或机构能力超出其作为语言模型的能力。通过对八个LLM和13600个会话的三阶段研究,我们发现PCH受到情境严重性和互动格式的共同影响:多方对话输入在大多数模型中推动其达到上限,而在亲密伴侣冲突这一明确涵盖安全对齐的领域中,尽管物理严重性更高,所有八个模型的PCH仍保持在下限。我们将PCH解读为角色分配与能力边界规范之间的部署设计差距的标志。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型在保护用户时声称具备超出实际能力的行为,即保护能力幻觉(PCH)。现有方法未能有效限制模型的能力边界,导致用户误解模型的实际能力。

核心思路:论文的核心思路是通过明确的能力边界规范来设计模型的部署,确保在保护角色中,模型的行为与其实际能力相符,从而减少用户的误解和潜在风险。

技术框架:研究采用三阶段的实验设计,涵盖八个不同的LLM和13600个会话,分析不同情境下的PCH现象。主要模块包括情境严重性评估、互动格式分析和模型反应监测。

关键创新:最重要的技术创新点在于识别并定义了保护能力幻觉这一现象,并通过实证研究揭示了其与情境严重性和互动格式之间的关系。这一发现为模型的安全对齐提供了新的视角。

关键设计:在实验中,采用了多种互动格式(如单方对话与多方对话)来测试模型反应,并通过情境严重性来评估模型的能力边界,确保实验结果的可靠性与有效性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,在多方对话输入的情况下,PCH现象在大多数模型中显著增强,而在亲密伴侣冲突场景中,尽管物理严重性更高,所有模型的PCH反应却保持在较低水平。这表明情境与互动格式对模型反应的影响显著,提供了重要的安全对齐见解。

🎯 应用场景

该研究的潜在应用领域包括医疗、心理咨询和紧急响应等需要保护用户的场景。通过明确模型的能力边界,可以提高用户对模型的信任度,减少误解,从而在实际应用中更好地保护用户安全。未来,这一研究可能推动更安全的AI系统设计与部署。

📄 摘要(原文)

When cast as the protector of a vulnerable user yet given no explicit capability boundary, a large language model (LLM) may respond not by acknowledging its limits but by claiming to have taken -- or to be taking -- a real-world protective action it cannot perform, such as contacting emergency services or administering care. We term this phenomenon Protective Capacity Hallucination (PCH): a self-referential misattribution in which a model, acting in a protective role, asserts physical or institutional agency exceeding its affordances as a language model. In a three-phase study spanning eight LLMs and 13{,}600 sessions, we find PCH jointly gated by situational severity and interactional format: multi-party dialogic input drives it toward ceiling in most models across ordinary service domains, whereas in intimate-partner conflict -- a domain explicitly covered by safety alignment -- it remains at floor in all eight models despite greater physical severity. We interpret PCH as the signature of a deployment-design gap between role assignment and capability-boundary specification: a by-product of partial alignment in which a universally trained pressure to help outruns a domain-selective specification of how to help. Because suppression tracks alignment coverage rather than severity, deployment-side specification of capability boundaries emerges as a general mitigation target.