AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation
作者: Yi Ting Shen, Kentaroh Toyoda, Alex Leung
分类: cs.CR, cs.AI
发布日期: 2026-07-13
备注: A reference implementation is available at https://github.com/VulcanLab/amt-x
💡 一句话要点
提出AMT-X框架以解决多轮攻击评估不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多轮攻击 安全评估 大型语言模型 红队评估 自适应利用 阶段结构 语义信号 多角色评审
📋 核心要点
- 现有的安全评估方法主要依赖单轮攻击,未能有效应对自适应多轮对手的威胁。
- AMT-X框架通过将攻击过程结构化为多阶段状态机,利用受害者的语义信号进行评估。
- 在多个前沿模型上,AMT-X在严格条件下的成功率显著提高,展示了其有效性和创新性。
📝 摘要(中文)
大型语言模型(LLMs)的安全评估主要依赖于单轮攻击数据集和单一评审,低估了来自自适应多轮对手的风险,并且报告的成功率未能区分部分可操作输出与完整操作细节的输出。我们提出了AMT-X(自适应多轮利用)框架,采用阶段结构的多轮红队评估。与以往依赖临时升级或自由形式目标计划的多轮攻击不同,AMT-X将攻击视为一个明确、可重复的多阶段状态机,受害者的语义信号驱动,并用多角色陪审团替代单一评审,使用阶段条件检查表来评估可操作伤害的成功率。在六个前沿受害者模型和七个审查子类别下,AMT-X在宽松评分阈值下的整体攻击成功率达到97.6%-100%,而在严格要求完整、真实和操作细节的阈值下成功率为66.7%-78.6%,部分与完全可操作伤害之间的差距高达33个百分点。
🔬 方法详解
问题定义:论文旨在解决大型语言模型安全评估中对多轮攻击的低估问题,现有方法多依赖单轮攻击数据,无法有效应对复杂的对抗场景。
核心思路:AMT-X框架通过将攻击过程明确化为多阶段状态机,利用受害者的语义信号进行驱动,确保攻击的可重复性和有效性。
技术框架:AMT-X的整体架构包括多个阶段,每个阶段都有明确的目标和条件,使用多角色陪审团进行评估,确保攻击的可操作性和有效性。
关键创新:AMT-X的主要创新在于其阶段结构化的攻击方式和多角色评审机制,与传统的临时和自由形式的攻击方法有本质区别。
关键设计:在设计中,AMT-X使用阶段条件检查表来评估攻击成功,设置了不同的评分阈值,以区分部分可操作和完全可操作的输出。具体的参数设置和损失函数设计尚未详细披露。
🖼️ 关键图片
📊 实验亮点
AMT-X在六个前沿受害者模型上实现了97.6%-100%的攻击成功率,在严格条件下的成功率为66.7%-78.6%。这表明AMT-X在评估可操作伤害方面的有效性,成功率的差距高达33个百分点,突显了其在多轮攻击评估中的重要性。
🎯 应用场景
AMT-X框架在大型语言模型的安全评估中具有广泛的应用潜力,能够有效识别和评估多轮攻击的风险。其结构化的评估方法可以为未来的安全研究提供新的思路,推动对抗性测试的标准化和系统化。该研究的成果也可能影响到AI系统的安全设计和监管政策的制定。
📄 摘要(原文)
Safety evaluation of large language models (LLMs) relies largely on single-turn attack datasets and single-judge scoring, underestimating risk from adaptive multi-turn adversaries and reporting a single success rate that does not separate partially actionable outputs from those carrying complete operational detail. We propose AMT-X (Adaptive Multi-Turn Exploitation), a phase-structured multi-turn red-teaming framework. Unlike prior multi-turn attacks that rely on ad hoc escalation or free-form per-goal plans, AMT-X casts the attack as an explicit, reproducible multi-phase state machine driven by semantic signals from the victim, and replaces single-judge scoring with a multi-role jury whose phase-conditioned checklists gate success on actionable harm. Across six frontier victim models (queried under their default safety alignment, without added moderation layers) and seven Moderation sub-categories, AMT-X attains overall attack success rates of 97.6-100% under a lenient score threshold, but 66.7-78.6% under a stricter gate requiring complete, real, and operational detail: a gap of up to 33 percentage points between partially and fully actionable harm.