Controlled Reformulation Testing for Logical Consistency in Large Language Models
作者: Alexander Gu, Alan Chen
分类: cs.CL, cs.AI
发布日期: 2026-07-16
备注: 10 pages
💡 一句话要点
提出CRTBench以评估大型语言模型的逻辑一致性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 逻辑一致性 大型语言模型 重述测试 推理能力 自然语言处理
📋 核心要点
- 现有大型语言模型在面对逻辑等价问题的不同表述时,常常出现自我矛盾,影响其逻辑推理能力的评估。
- 本文提出了CRTBench基准测试,旨在通过控制重述来评估LLMs在逻辑一致性方面的表现。
- 实验结果显示,尽管GPT-5.4-mini的准确率高达98.9%,但其逻辑一致性仅为60.3%,揭示了准确率与逻辑推理能力之间的差距。
📝 摘要(中文)
大型语言模型(LLMs)在逻辑等价问题的表述变化时,常常出现自我矛盾。本文提出了一个包含350个问题家族(共1750个问题)的基准测试CRTBench,用于评估逻辑不变性。我们研究了LLMs在控制重述下保持一致答案的能力,包括逆命题重写、双重否定、否定翻转和被动语态等。实验结果显示,GPT-5.4-mini在基准准确率为98.9%的情况下,家庭级一致性仅为60.3%,而经过推理优化的o4-mini达到了96.9%的一致性。实验还发现,失败主要集中在逻辑非平凡的变换上,如逆命题重写(GPT-5.4-mini为72.4%)和双重否定(84.6%),而表面重述保持稳健(94-100%)。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在逻辑等价问题表述变化时出现的自我矛盾现象。现有方法未能有效评估模型的逻辑一致性,导致推理能力的评估不准确。
核心思路:论文提出了CRTBench基准测试,通过控制重述的方式,系统性地评估LLMs在不同逻辑变换下的回答一致性,以此来衡量其逻辑推理能力。
技术框架:整体架构包括问题生成、重述控制和一致性评估三个主要模块。首先生成逻辑等价的问题,然后进行不同形式的重述,最后评估模型在这些重述下的回答一致性。
关键创新:最重要的技术创新在于提出了CRTBench这一基准测试,系统性地考察了LLMs在逻辑重述下的表现,填补了现有评估方法的空白。
关键设计:在实验中,设置了多种重述形式,包括逆命题、双重否定等,并通过精确的评估指标来量化模型的回答一致性,确保评估结果的可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,GPT-5.4-mini在基准测试中的准确率为98.9%,但家庭级一致性仅为60.3%,而经过推理优化的o4-mini达到了96.9%的逻辑一致性。特别是在逆命题重写和双重否定的情况下,GPT-5.4-mini的失败率分别为72.4%和84.6%。这些结果表明,单纯的准确率并不足以全面评估LLMs的逻辑推理能力。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能问答系统和对话系统等。通过提高大型语言模型的逻辑一致性,可以增强其在复杂推理任务中的表现,提升用户体验和信任度。未来,该方法还可能推动更高效的模型设计和评估标准的建立。
📄 摘要(原文)
Large language models (LLMs) frequently contradict themselves when the surface form of a logically equivalent question changes. We present a benchmark of 350 question families (1,750 total questions) for Controlled Reformulation Testing (CRTBench) to evaluate logical invariance. In this benchmark, we investigate LLMs' ability to maintain consistent answers across controlled reformulations, which include contrapositive rewriting, double negation, negation flipping, and passive voice. We evaluate several frontier LLMs and observe an accuracy-consistency gap where GPT-5.4-mini achieves $98.9\%$ base accuracy but only $60.3\%$ family-level consistency, while reasoning-optimized o4-mini achieves $96.9\%$ consistency. From our experiments, we observe that failures cluster around logically nontrivial transformations such as contrapositive rewriting ($72.4\%$ for GPT-5.4-mini) and double negation ($84.6\%$), while surface-level rephrasing remains robust ($94-100\%$). Increasing reasoning effort improves GPT-5.4-mini to $85.4\%$ consistency, but leaves GPT-5.4 unchanged overall because gains on nested negation are offset by failures on quantifier families. These results show that accuracy alone is not enough for evaluating logical reasoning in LLMs.