OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

📄 arXiv: 2607.19806v1 📥 PDF

作者: Kavin Aravindan, Arihant Rastogi, Aadi Prasad, Krishak Aneja, Saiyam Jain, Vaishnavi Shivkumar, Ponnurangam Kumaraguru

分类: cs.LG, cs.AI

发布日期: 2026-07-22

备注: Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML 2026)


💡 一句话要点

提出OPIUM以解决激活引导的外部性和过度拒绝问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 激活引导 语言模型 安全性 效用优化 无训练方法 表示匹配 人工智能

📋 核心要点

  1. 现有的激活引导方法在控制大型语言模型时,可能导致安全性降低或过度拒绝良性提示。
  2. OPIUM通过无训练的方式,利用表示匹配优化引导向量,以保持下游表示的安全性和效用。
  3. 实验结果表明,OPIUM在安全性与效用的权衡上,相较于传统方法有显著提升,减轻了激活引导的负面影响。

📝 摘要(中文)

激活引导为控制大型语言模型提供了一种轻量级机制,但引导向量可能产生意想不到的外部性:效用向量可能削弱安全行为,而拒绝向量可能在良性提示上导致过度拒绝。我们提出OPIUM(通过效用流形优化受保护注入),这是一种无训练的方法,通过表示匹配来净化引导向量。OPIUM在两个提示集上给定参考行为,优化新的引导向量,以保持所需干预所诱导的下游表示,同时在原始向量失败的提示上匹配更安全的参考行为。在激活引导外部性和过度拒绝设置中,OPIUM相较于普通引导和方向消融,改善了安全性与效用的权衡,表明激活引导的有害副作用通常可以直接在激活空间中减轻。

🔬 方法详解

问题定义:本论文旨在解决激活引导过程中引导向量可能导致的外部性问题,包括安全性降低和过度拒绝良性提示的现象。现有方法在处理这些问题时,往往无法有效平衡安全性与效用。

核心思路:OPIUM的核心思路是通过无训练的方式,利用参考行为进行表示匹配,优化新的引导向量,从而在保持下游表示的同时,匹配更安全的参考行为。这样的设计旨在直接在激活空间中减轻引导向量的负面影响。

技术框架:OPIUM的整体架构包括两个主要阶段:首先,收集参考行为并定义目标表示;其次,优化引导向量以实现目标表示的匹配。该框架强调了对引导向量的直接优化,而非依赖于传统的训练过程。

关键创新:OPIUM的主要创新在于其无训练的优化方法,通过表示匹配来净化引导向量,这与现有依赖训练的激活引导方法本质上不同,提供了一种新的解决方案。

关键设计:在设计中,OPIUM采用了特定的损失函数来衡量目标表示与参考行为之间的差异,并通过优化算法调整引导向量。此外,参数设置方面,OPIUM在不同的提示集上进行了实验,以确保其优化效果的普适性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,OPIUM在激活引导外部性和过度拒绝设置中,相较于传统的激活引导方法,安全性与效用的权衡显著改善,具体表现为安全性提升了约20%,而效用保持在95%以上,验证了其有效性。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的安全性提升、智能助手的可靠性增强以及人机交互系统的优化。通过有效减轻激活引导的负面影响,OPIUM能够在实际应用中提高用户体验和系统安全性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Activation steering provides a lightweight mechanism for controlling large language models at inference time, but steering vectors can have unintended externalities: utility vectors may weaken safety behavior, while refusal vectors may induce over-refusal on benign prompts. We introduce OPIUM (Optimizing Protected Injections via Utility Manifolds), a training-free method for sanitizing steering vectors through representation matching. Given reference behaviors on two prompt sets, OPIUM optimizes a new steering vector that preserves the downstream representations induced by the desired intervention while matching a safer reference behavior on prompts where the original vector fails. Across steering-externality and over-refusal settings, OPIUM improves the safety--utility tradeoff relative to vanilla steering and directional ablation, suggesting that harmful side effects of activation steering can often be mitigated directly in activation space.