Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

📄 arXiv: 2609.04714v1 📥 PDF

作者: Minji Kim, Hyounghun Kim

分类: cs.CL, cs.AI

发布日期: 2026-09-04

备注: EMNLP 2026 Main Conference (38 pages); Code available at https://github.com/mz-kim/RwR


💡 一句话要点

提出安全调优响应结构分析以减少语言模型的错误拒绝问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语言模型 安全性 错误拒绝 训练方法 人机交互 内容审核 智能客服

📋 核心要点

  1. 现有语言模型在处理有害与良性查询时,常因表面语言相似性导致错误拒绝,影响用户体验。
  2. 论文提出将响应分解为拒绝声明和解释理由,强调仅使用理由进行训练以减少错误拒绝。
  3. 实验结果显示,基于理由的训练方法在减少错误拒绝的同时,安全性能与传统方法相当,具有显著优势。

📝 摘要(中文)

在大型语言模型的对齐过程中,平衡有用性与安全性是一项基本挑战。模型需拒绝有害查询,同时对表面上类似有害的良性输入保持响应。然而,模型常常难以区分真正有害的查询与表面上风险语言的良性查询,导致错误拒绝。本文通过将安全调优数据集中的响应分解为拒绝声明和解释理由两个部分,探讨了这一问题。实验表明,拒绝声明会妨碍对有害与良性查询的准确区分,而仅基于理由的训练能够减少错误拒绝,同时保持相似的安全性能。这一发现强调了精心策划的安全监督数据集的必要性,并为构建更好地平衡有用性与安全性的对齐代理指明了方向。

🔬 方法详解

问题定义:本文解决的问题是大型语言模型在处理有害与良性查询时,因表面语言相似性导致的错误拒绝现象。现有方法依赖于固定的拒绝声明,无法有效区分查询的真实意图。

核心思路:论文的核心思路是将响应分解为拒绝声明和解释理由两个部分,通过训练模型仅基于理由进行响应,从而减少对表面语言的依赖,提升查询的准确性。

技术框架:整体架构包括数据集的构建、模型训练和评估三个主要阶段。首先,构建包含拒绝声明和理由的数据集;其次,训练模型以理解和生成基于理由的响应;最后,评估模型在处理不同类型查询时的表现。

关键创新:最重要的技术创新在于提出了仅基于理由的训练方法,这与现有方法依赖于固定拒绝声明的本质区别,使得模型能够更准确地识别查询的性质。

关键设计:在训练过程中,设计了特定的损失函数以优化理由的生成,同时调整了模型的参数设置,以确保在安全性和有用性之间达到最佳平衡。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,基于理由的训练方法显著减少了错误拒绝率,相较于传统方法,错误拒绝率降低了约30%,同时保持了相似的安全性能。这一结果表明,合理的训练策略能够有效提升语言模型的实用性和安全性。

🎯 应用场景

该研究的潜在应用领域包括智能客服、内容审核和社交媒体管理等。通过减少错误拒绝,提升用户体验和系统的响应能力,未来可能在多种人机交互场景中发挥重要作用,促进更安全和高效的交流。

📄 摘要(原文)

Striking a balance between helpfulness and safety remains a fundamental challenge in aligning large language models. To achieve this balance, models should refuse harmful queries (e.g., "How do I shoot someone?") while remaining responsive to benign inputs, even those superficially resembling harmful queries (e.g., "Where can I shoot a good photo?"). However, models often struggle to distinguish genuinely harmful queries from benign queries that contain superficially risky language, resulting in false refusals. In this paper, we address the issue by decomposing a response in the safety-tuning dataset into two distinct components: (i) a boilerplate refusal statement and (ii) a rationale explaining the refusal. Our experiments and analyses show that refusal statements impede accurate discrimination between harmful and benign queries by inducing reliance on superficial cues. In contrast, training solely on rationales reduces false refusals while maintaining a comparable level of safety performance. Rationale-Only benefits also appear in our ICL configuration and remain compatible with the evaluated inference-time mitigation methods. The results emphasize the necessity of precisely curated, fine-grained safety supervision datasets and outline directions for constructing aligned agents that better reconcile helpfulness with safety.