When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
作者: Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu
分类: cs.AI, cs.CR
发布日期: 2026-07-16
💡 一句话要点
提出PRISM以解决语言模型在物理安全性中的风险问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 物理安全性 内容危险 大型语言模型 风险检测 探测器 隐藏状态分析 智能体安全
📋 核心要点
- 现有方法未能有效区分语言模型中的内容危险与物理危险,导致潜在的安全隐患。
- 论文提出PRISM,通过分析隐藏状态来探测物理危险,利用CD和PD的可分性进行设计。
- 实验结果表明,PRISM在多个基准测试中表现优异,准确率显著高于现有模型,降低了误报率。
📝 摘要(中文)
大型语言模型(LLMs)越来越多地作为具身智能体的高层规划者,但在物理世界中,语言上无害的指令可能变得不安全。本文研究了物理危险(PD)与内容危险(CD)在LLM表示中的可分性,并提出了PRISM,一个单层L2正则化的逻辑探测器。PRISM在SafeAgentBench上实现了86.2%至87.7%的准确率,且在PhysicalSafetyBench-1K上达到了99.6%的准确率,显示出其在检测物理安全性方面的有效性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在物理环境中执行任务时,语言指令与实际行为之间的安全性差异。现有方法未能有效识别内容危险与物理危险的不同,导致安全风险未被充分评估。
核心思路:论文的核心思路是通过隐藏状态分析,探测物理危险(PD)与内容危险(CD)的可分性,提出PRISM作为一种新型探测器,能够在不依赖直接危险关键词的情况下识别物理风险。
技术框架:PRISM是一个单层L2正则化的逻辑探测器,利用LLM的全隐藏状态进行训练和评估。整体流程包括数据准备、模型训练、风险检测和性能评估等主要模块。
关键创新:PRISM的最大创新在于其能够有效区分内容危险与物理危险,且在多个基准测试中表现出色,显著提高了物理安全性检测的准确性。
关键设计:PRISM采用L2正则化的逻辑回归模型,设置了适当的损失函数以优化分类性能,并在多个大型语言模型上进行验证,确保其广泛适用性。通过对比实验,PRISM在误报率上表现优于同规模的LLM。
🖼️ 关键图片
📊 实验亮点
PRISM在SafeAgentBench上实现了86.2%至87.7%的准确率,且在PhysicalSafetyBench-1K上达到了99.6%的准确率,误报率仅为0.7%。相比之下,Qwen2.5-3B模型在相同任务中的误报率高达24.7%至39.0%。这些结果表明,PRISM在物理安全性检测方面具有显著优势。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、机器人控制和人机交互等场景,能够有效提高智能体在执行任务时的安全性。通过准确识别物理风险,PRISM有助于减少事故发生的可能性,提升系统的可靠性和用户信任度。未来,该技术可能在更广泛的智能系统中得到应用,推动安全智能体的发展。
📄 摘要(原文)
Large language models (LLMs) increasingly serve as high-level planners for embodied agents, where linguistically benign instructions can become unsafe once grounded in the physical world. We study whether this physically grounded danger is the same safety problem as ordinary text-level content danger. Through hidden-state direction analysis and random-split null tests, we show that content danger (CD) and physical danger (PD) form separable signals in LLM representations across Qwen2.5-3B/7B/14B/32B, Phi-3.5 and SmolLM2. Building on the CD/PD separability, we propose PRISM, a single-layer L2-regularized logistic probe over full hidden states. PRISM achieves 86.2--87.7\% accuracy on SafeAgentBench with 11.7--13.7\% FPR, while same-scale LLM judges over-block safe tasks at 24.7--39.0\% FPR. We further introduce PhysicalSafetyBench-1K (PSB-1K), a contrastive benchmark of 1{,}000 physical-risk pairs without direct harm keywords, to test whether methods detect physically grounded danger rather than explicit unsafe wording. On PSB-1K, PRISM reaches 99.6\% accuracy and 0.7\% FPR, whereas a Qwen2.5-3B judge rejects 67.8\% of safe tasks. PRISM also replicates on SafeText and EARBench, supporting hidden-state probing as a representation-level method for physical safety beyond text moderation.