Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal
作者: Kia-Jüng Yang, Dominik Meier, Jiachen Zhao, Terry Ruas, Bela Gipp
分类: cs.AI, cs.LG
发布日期: 2026-07-20
💡 一句话要点
提出链式思维干扰以解决拒绝控制问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型推理模型 链式思维 拒绝控制 激活引导 动态重构
📋 核心要点
- 现有大型推理模型在拒绝控制方面面临挑战,特别是链式思维对拒绝的影响尚未被充分理解。
- 论文提出通过激活引导和链式思维的动态重构来逆转拒绝,从而改善拒绝控制的效果。
- 实验结果显示,在两阶段干预下,拒绝逆转率可达94%,表明链式思维在拒绝控制中起到关键作用。
📝 摘要(中文)
大型推理模型(LRMs)在生成最终输出之前会产生链式思维(CoT)轨迹,这引入了动态内部状态,可能使拒绝控制机制变得复杂。与单向子空间调优的指令调优LLMs不同,LRMs中的拒绝还依赖于CoT。研究表明,在固定CoT的情况下,激活引导仅在39%的情况下逆转拒绝,而完全移除CoT则提高到70%。在模型在激活引导下重新生成CoT的两阶段干预中,拒绝逆转率达到94%。这些发现表明,LRMs中的拒绝信息同时编码在残差流激活和CoT中。
🔬 方法详解
问题定义:论文要解决的问题是大型推理模型(LRMs)中拒绝控制的复杂性,现有方法在处理链式思维(CoT)对拒绝的影响时存在不足。
核心思路:论文的核心思路是通过激活引导和重新生成CoT来逆转拒绝,利用CoT的动态特性来增强模型的控制能力。
技术框架:整体架构包括两个主要阶段:第一阶段是固定CoT下的激活引导,第二阶段是模型在激活引导下重新生成CoT。
关键创新:最重要的技术创新在于揭示了CoT在拒绝控制中的独立作用,表明拒绝信息不仅依赖于残差流激活,还与CoT的动态变化密切相关。
关键设计:在实验中,采用了特定的激活引导策略,并设计了两阶段的干预流程,以确保模型能够有效地重构CoT并逆转拒绝。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在固定CoT的情况下,激活引导仅能逆转39%的拒绝,而完全移除CoT则提高到70%。在两阶段干预中,拒绝逆转率高达94%,表明链式思维在拒绝控制中具有重要作用。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的对话系统和智能助手,能够提高模型在拒绝请求时的灵活性和准确性。未来,研究成果可能推动更复杂的交互系统的发展,使其在处理用户请求时更加智能和人性化。
📄 摘要(原文)
Large reasoning models (LRMs) generate chain-of-thought (CoT) traces before producing final outputs, introducing a dynamic internal state that may complicate control mechanisms such as refusal. Unlike instruction-tuned LLMs, where refusal is mediated by a single directional subspace, refusal in large reasoning models (LRMs) additionally depends on the CoT. In DeepSeek-R1-Distill-LLaMA-8B, activation steering reverses refusal in only 39% of cases when the CoT is kept fixed, but removing the CoT entirely increases this to 70%, indicating that the CoT actively reinforces refusal. In a two-stage intervention where the model regenerates its CoT under activation steering, refusal is reversed in 94% of cases, while the resulting CoT alone retains 48% of this effect even after steering is removed. This suggests that the CoT can carry and reconstruct the compliance signal independently. These findings indicate that refusal in LRMs is jointly encoded in residual stream activations and CoT. This joint activation makes LRM more robust against activation-level interventions alone, but exposes CoT to a possible alternative surface attack.