Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

📄 arXiv: 2607.15286 📥 PDF

作者: Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi

分类: cs.CR, cs.CL, cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出可转移的思维链条以应对语言模型的有害行为

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 有害推理 思维链条 越狱攻击 语言模型 安全性评估 系统提示 黑箱攻击

📋 核心要点

  1. 现有方法在处理受损语言模型的有害行为时存在不足,难以有效识别和防范潜在的越狱攻击。
  2. 论文提出通过移植有害思维链条并提炼成可重用的系统提示,以增强对不安全行为的识别和防范能力。
  3. 实验结果显示,转移的有害思维链条使得开源模型的有害响应率超过80%,并在性能上实现了显著提升。

📝 摘要(中文)

本研究探讨了受损语言模型中有害思维链条(CoT)是否能够转移不安全行为,并被提炼为可重用的越狱攻击。通过将有害的思维链条移植到29个开源和5个闭源目标中,发现转移的痕迹使得最脆弱的开源模型的有害响应率超过80%。此外,LLooM概念挖掘识别出有害推理的四个重复组成部分:程序化、伦理解耦、规避和目标脆弱性框架。将这些模式提炼为可重用的系统提示,产生了有效的黑箱越狱攻击,性能比直接的思维链条移植提升了十倍,包括在GPT-4.1 AdvBench上的显著改进。研究结果表明,有害推理在痕迹和模式层面上均可转移,促使我们开发评估推理上下文的防御机制。

🔬 方法详解

问题定义:本论文旨在解决受损语言模型中有害思维链条的转移问题,现有方法在识别和防范这些有害行为时存在显著挑战,尤其是在越狱攻击的有效性上。

核心思路:论文的核心思路是通过将有害的思维链条移植到不同的模型中,并提炼出可重用的系统提示,从而提高对有害行为的识别能力和防范效果。这样的设计使得攻击者能够利用这些模式进行更有效的越狱攻击。

技术框架:整体架构包括两个主要阶段:首先是有害思维链条的识别与移植,其次是将这些链条提炼为可重用的系统提示。关键模块包括LLooM概念挖掘和黑箱越狱攻击生成。

关键创新:最重要的技术创新在于识别并提炼出有害推理的四个组成部分,并通过这些模式生成有效的越狱攻击。这与现有方法的本质区别在于,现有方法往往未能考虑思维链条的可转移性。

关键设计:在参数设置上,论文采用了针对不同模型的优化策略,损失函数设计考虑了有害行为的识别精度,网络结构则基于现有的语言模型进行调整,以提高对有害推理的敏感性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,转移的有害思维链条使得最脆弱的开源模型的有害响应率超过80%。通过提炼的系统提示,黑箱越狱攻击的效果比直接的思维链条移植提升了十倍,尤其在GPT-4.1 AdvBench上表现尤为突出。

🎯 应用场景

该研究的潜在应用领域包括安全性评估、语言模型的防护机制设计以及人工智能系统的伦理审查。通过识别和防范有害行为,可以提升语言模型在实际应用中的安全性和可靠性,减少潜在的社会风险。

📄 摘要(原文)

We investigate whether harmful chain-of-thought (CoT) traces from compromised language models can transfer unsafe behaviour and be distilled into reusable jailbreak attacks. Using an emergent-misalignment organism and a refusal-ablated jailbroken organism, we transplant harmful CoTs into $29$ open-source and $5$ closed-source targets. Transferred traces raise harmful-response rates above $80\%$ on the most vulnerable open-source models, while semantically mismatched CoTs fail entirely. LLooM concept mining identifies four recurring components of harmful reasoning: proceduralisation, ethical decoupling, evasion, and target--vulnerability framing. Distilling these patterns into reusable system prompts produces effective black-box jailbreaks, outperforming direct CoT transplantation on strongly aligned models by up to an order of magnitude, including a $10\times$ improvement on GPT-4.1 AdvBench. Reasoning-enabled models are more than twice as vulnerable, and output-side safeguards such as Llama-Guard~3 frequently miss harmful generations. Our results show that harmful reasoning transfers at both the trace and pattern levels, motivating defences that evaluate reasoning context in addition to final outputs.