MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

📄 arXiv: 2607.11070v1 📥 PDF

作者: Junyoung Park, Namgyu Park, Sechan Lee, Yoon-Chan Jhi, Jihoon Cho, Sangdon Park

分类: cs.CL

发布日期: 2026-07-13

备注: 29 pages. Warning: This paper contains examples of harmful content


💡 一句话要点

提出DC-GRPO框架以解决多轮对话中的信用分配问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多轮对话 信用分配 越狱攻击 大型语言模型 自动化红队 对抗性学习 组相对优化

📋 核心要点

  1. 现有方法在多轮对话中面临信用分配的挑战,难以准确识别各轮次对最终结果的贡献。
  2. 本文提出DC-GRPO框架,通过组合即时和未来信用,实现轮次级的信用分配,提升多轮越狱学习效果。
  3. 实验结果显示,动态和静态加权变体的ASR5@3分数分别达到98.26%和97.88%,显著优于现有最优方法。

📝 摘要(中文)

现代大型语言模型(LLMs)在交互式多轮对话中运行,使得多轮越狱成为一种现实威胁模型和自动化红队的重要场景。学习多轮越狱攻击者的核心挑战在于信用分配:不同轮次对最终结果的贡献不同,而现有学习信号往往过于粗糙,无法识别其个体贡献。本文提出了一种统一的轮次级信用分配框架DC-GRPO,通过结合即时和未来信用,为每个轮次分配单独的组相对学习信号,避免了通过广播单一轨迹级得分引起的信用误分配。在多个受害者LLM和基准测试中,动态和静态加权变体分别实现了98.26%和97.88%的平均ASR5@3分数,显著超越了包括SEMA(86.58%)和TROJail(86.23%)在内的最新方法。其持续强劲的表现表明,主要的经验收益来自于轮次级组相对信用分配,而非特定的加权规则。

🔬 方法详解

问题定义:本文旨在解决多轮对话中信用分配不准确的问题。现有方法通常使用单一的轨迹级得分,导致无法有效识别不同轮次的贡献,影响越狱攻击的学习效果。

核心思路:提出DC-GRPO框架,通过为每个轮次分配独立的组相对学习信号,结合即时和未来信用,避免了信用误分配的问题。这种设计使得模型能够更精确地学习每个轮次的贡献。

技术框架:DC-GRPO框架包括两个主要模块:静态加权和动态加权。静态加权在不同轮次之间保持固定的权重比例,而动态加权则根据对话的上下文动态调整权重。两者共享相同的轮次级结构,确保灵活性和适应性。

关键创新:最重要的技术创新在于轮次级组相对信用分配的实现,这与现有方法的单一轨迹级得分显著不同。通过这种创新,模型能够更好地捕捉多轮对话中的复杂交互。

关键设计:在参数设置上,DC-GRPO框架采用了不同的加权规则,确保即时和未来信用的平衡。损失函数设计上,结合了多轮对话的特性,以优化每个轮次的学习效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,DC-GRPO框架的动态和静态加权变体在多个受害者LLM上分别达到了98.26%和97.88%的ASR5@3分数,显著超越了现有的最优方法SEMA(86.58%)和TROJail(86.23%),展示了其在多轮越狱学习中的强大性能。

🎯 应用场景

该研究的潜在应用领域包括自动化红队测试、对抗性攻击防御和智能对话系统的安全性提升。通过改进多轮对话中的越狱攻击学习,能够有效增强LLM的鲁棒性,降低被攻击的风险,具有重要的实际价值和未来影响。

📄 摘要(原文)

Modern large language models (LLMs) operate in interactive multi-turn settings, making multi-turn jailbreaking a realistic threat model and an important setting for automated red teaming. A core challenge in learning multi-turn jailbreak attackers is credit assignment: different turns contribute differently to the final outcome, yet existing learning signals are often too coarse to identify their individual contributions. We propose decomposed credit GRPO (DC-GRPO), a unified turn-level credit assignment framework for Group Relative Policy Optimization in multi-turn jailbreak learning. DC-GRPO assigns a separate group-relative learning signal to each turn by combining immediate and future credit, avoiding the credit misassignment induced by broadcasting a single trajectory-level score across the dialogue. We instantiate this framework with static and dynamic weighting rules that differ in how the two credit sources are balanced while sharing the same turn-level structure. Across multiple victim LLMs and benchmarks, the dynamic- and static-weighted variants achieve average ASR5@3 scores of 98.26% and 97.88%, respectively, substantially outperforming the state-of-the-art methods, including SEMA (86.58%) and TROJail (86.23%). Their consistently strong performance indicates that the central empirical benefit comes from turn-level group-relative credit assignment rather than a particular weighting rule. Warning: This paper contains examples of harmful content.