Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
作者: Alejo López-Ávila, Iker García-Ferrero, Jezabel Garcia, Antonio Tiene, Román Orús
分类: cs.CL
发布日期: 2026-09-03
备注: 22 pages, 14 figures
💡 一句话要点
提出边界感知自蒸馏方法以解决LLM安全拒绝问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 安全对齐 自蒸馏 大型语言模型 拒绝响应 数据补偿 主题生成 覆盖修复
📋 核心要点
- 现有方法在处理不同应用场景时,无法有效区分安全拒绝的边界,导致不一致的响应。
- 本文提出了一种边界感知自蒸馏框架,通过受控主题生成和数据补偿来优化模型的拒绝能力。
- 实验表明,使用新方法后,目标领域的拒绝率显著提高,同时不安全响应率大幅降低,验证了方法的有效性。
📝 摘要(中文)
安全对齐通常被视为一个主题层面的问题:该主题是否有害?而在实际应用中,问题则更为具体。比如,公民教育辅导员和公共部门助手可能共享基础模型,但在同一主题内需要不同的拒绝边界。本文提出了一种离线自生成框架,结合了受控主题生成、覆盖修复、分布内补偿数据和有害-良性对进行训练和评估。实验结果显示,通过逐步重试的方法,目标领域的拒绝率从9.47%提升至84.75%,而不安全响应率显著降低。这表明数据组成在安全性与可用性之间的权衡中起着关键作用。
🔬 方法详解
问题定义:本文旨在解决在不同应用场景下,如何有效管理大型语言模型(LLM)的安全拒绝边界问题。现有方法往往无法针对特定场景进行有效的拒绝响应,导致安全性不足。
核心思路:提出了一种边界感知自蒸馏框架,通过受控主题生成和覆盖修复等技术,来生成更符合特定场景需求的拒绝响应,从而提高模型的安全性和适用性。
技术框架:整体框架包括四个主要模块:受控主题生成、覆盖修复、分布内补偿数据生成和有害-良性对的构建。通过这些模块的协同作用,模型能够在不同的应用场景中实现更精确的拒绝响应。
关键创新:最重要的创新在于引入了边界感知的自蒸馏机制,使得模型能够在训练过程中学习到不同场景下的拒绝边界,从而实现更高的安全性和准确性。
关键设计:在模型训练中,采用了特定的损失函数来平衡拒绝率和不安全响应率,同时通过构建有害-良性对来增强模型的学习效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用逐步重试的方法后,目标领域的拒绝率从9.47%提升至84.75%,而不安全响应率从26.26%降至0.14%。此外,通过替换外部响应,过度拒绝率从15.20%降低至5.20%,验证了新方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括教育、公共服务和社交媒体等场景,尤其是在需要对敏感话题进行处理时。通过优化模型的拒绝能力,可以有效防止不当信息传播,提高用户的安全感和信任度。未来,该方法有望推广至更多需要安全对齐的人工智能应用中。
📄 摘要(原文)
Safety alignment is usually posed as a topic-level question: is this subject harmful? Deployments ask a narrower one. A civics tutor and a public-sector assistant may share a base model yet need different boundaries inside the same topic, refusing targeted political manipulation while still answering factual questions about the same election. We formulate this as narrow-boundary safety and introduce an offline self-generated framework combining controlled topic generation, coverage repair, in-distribution compensation data, and harmful-benign pairs for training and evaluation. Single-shot generation leaves 19.88% of prompts without accepted refusal traces, whereas escalating retries leave 0.20%. On political persuasion with Qwen3-8B, training on refusal data completed through Escalate increases target-domain refusal from 9.47% to 84.75% and reduces the mean unsafe-response rate across three broader harmfulness benchmarks from 26.26% to 0.14%, but increases XSTest over-refusal from 2.00% to 74.00%. In a separate matched comparison, replacing external responses with verified target-model responses reduces over-refusal from 15.20% to 5.20%. Boundary-pair data reduces comply-side over-refusal on held-out pairs from 32.94% to 4.16%, while harmful-side refusal decreases only from 91.88% to 87.72%. These results show that data composition controls the safety and usability trade-off, and that safety alignment should be evaluated on both sides of the intended refusal boundary.