Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations
作者: Silvia Santano
分类: cs.AI
发布日期: 2026-07-08
💡 一句话要点
提出推理一致性扫描框架以审计AI安全评估中的思维链有效性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 推理一致性 AI安全评估 模型验证 思维链推理 实验干预
📋 核心要点
- 现有方法在检测思维链推理的可靠性时,往往需要实验干预,限制了其应用。
- 本文提出推理一致性扫描,通过分析记录中的推理与答案的一致性,提供了一种无需干预的检测方法。
- 实验结果表明,推理不一致性在不同模型和任务类型中普遍存在,且可被有效检测。
📝 摘要(中文)
先前的研究表明,思维链推理常常不可靠:模型所述的推理并不可靠地反映其输出的生成过程。然而,检测这种不可靠性需要控制实验干预,无法在评估记录后进行。本文转向一个更易处理的问题:所述推理是否与其伴随的答案在逻辑上是一致的。我们引入推理一致性扫描,这是一种可重复使用的方法,用于检测AI安全评估记录中的这一特性。我们的贡献主要有四个方面:首先,我们将推理一致性形式化,与可靠性区分开,并定义了六种不一致的分类;其次,我们构建了一个经过验证的60个记录的基准;第三,我们实现了一个针对InspectScout的工作扫描器,这是首个针对安全评估记录中该特性的工具;最后,我们报告了四个生成模型和三个评估的结果,显示推理不一致性是存在的、可检测的,并且在模型和任务类型之间系统性变化。
🔬 方法详解
问题定义:本文旨在解决AI模型在推理过程中所表现出的不一致性问题。现有方法主要关注推理的可靠性,但往往需要实验干预,难以在评估记录后进行分析。
核心思路:我们提出推理一致性扫描,通过分析模型的推理过程与最终答案之间的逻辑一致性,提供了一种无需干预的检测方法。这种方法使得我们能够在评估记录中直接识别出推理的不一致性。
技术框架:整体架构包括数据收集、推理一致性分析和结果报告三个主要模块。首先,从InstrumentalEval输出中手动适配60个评估记录;其次,利用扫描器分析这些记录中的推理与答案的一致性;最后,生成报告以展示检测结果。
关键创新:本文的主要创新在于将推理一致性形式化为与可靠性不同的概念,并提出了六种不一致的分类。这一创新使得我们能够更细致地分析推理过程中的问题。
关键设计:在技术实现上,我们设计了一个针对InspectScout的扫描器,能够有效识别推理不一致性。该扫描器的参数设置经过验证,以确保其在不同模型和任务类型中的适用性。我们还构建了一个基准数据集,以支持这一方法的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,推理不一致性在四个生成模型和三个评估任务中普遍存在,且可被有效检测。具体而言,检测结果表明不同模型和任务类型之间的推理不一致性存在系统性变化,为后续研究提供了重要的实证依据。
🎯 应用场景
该研究的潜在应用领域包括AI安全评估、模型验证和推理过程的审计。通过提供一种有效的检测推理一致性的方法,能够帮助开发者和研究人员更好地理解和改进AI模型的推理能力,提升其在实际应用中的安全性和可靠性。未来,该方法可能会在更广泛的AI系统中得到应用,推动AI技术的安全发展。
📄 摘要(原文)
Prior work has shown that chain-of-thought (CoT) reasoning is often unfaithful: a model's stated reasoning does not reliably reflect the process that produced its output. Detecting unfaithfulness, though, requires controlled experimental interventions, which cannot be applied to evaluation transcripts after the fact. We turn instead to a more tractable question that has received less attention: whether the stated reasoning is logically consistent with the answer it accompanies. Unlike faithfulness, consistency can be assessed from a transcript alone, with no intervention. We introduce reasoning consistency scanning, a reusable method for detecting this property in AI safety evaluation transcripts. Our contributions are fourfold. First, we formalize reasoning consistency as distinct from faithfulness and define a six-subtype taxonomy of inconsistency. Second, we build a validated benchmark of 60 transcripts, manually adapted from InstrumentalEval outputs. Third, we implement a working scanner for InspectScout, the first to target this property in safety evaluation transcripts. Fourth, we report results across four generator models and three evaluations from inspect_evals, showing that reasoning inconsistency is present, detectable, and varies systematically across both models and task types.