Evaluating and Improving Evidence-Grounded Fact-Checking in LLMs via Multi-Round Evidence Ablation
作者: Xingyu Deng, Mingzi Cao, Nikolaos Aletras, Xi Wang, Mark Stevenson
分类: cs.CL, cs.AI, cs.IR
发布日期: 2026-09-08
备注: CIKM'26
💡 一句话要点
提出REAL框架以提升LLM的证据依赖性和事实核查能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 事实核查 大型语言模型 证据依赖性 反事实学习 模型训练
📋 核心要点
- 现有的LLMs在事实核查中表现良好,但它们往往依赖于内置的参数知识,而非实际证据。
- 本文提出了REAL框架,通过反事实证据监督来增强LLMs对证据的依赖性,从而提高事实核查的准确性。
- 在四个不同领域的事实核查数据集上,REAL训练的模型在证据依赖性上显著优于传统微调模型。
📝 摘要(中文)
自动事实核查系统通过相关文档中的证据评估声明的真实性。大型语言模型(LLMs)在事实核查中表现出色,但尚不清楚它们是否真正利用提供的证据进行判断。为此,本文引入了事实消融评估(FAE)框架,逐步消融引用证据,以评估LLMs是否相应地修正预测。实验证明,现有LLMs更依赖于其参数知识而非提供的证据。为弥补预测准确性与证据基础之间的差距,本文提出了REAL(严格证据消融学习)框架,通过反事实证据监督促进LLM作为验证者模型的证据依赖性。实验结果显示,使用REAL训练的模型在证据依赖能力上优于标准微调模型。
🔬 方法详解
问题定义:本文旨在解决当前LLMs在事实核查中对证据的依赖性不足的问题。现有方法往往依赖于模型的参数知识,而非实际提供的证据,导致核查结果的可靠性降低。
核心思路:论文的核心思路是通过引入REAL框架,利用反事实证据监督来促进LLMs在做出判断时更依赖于提供的证据。这种设计旨在缩小模型预测的准确性与证据基础之间的差距。
技术框架:整体架构包括事实消融评估(FAE)和REAL训练框架。FAE通过逐步消融证据来评估模型的预测修正,而REAL则通过反事实证据监督来训练模型,使其在验证过程中更依赖于证据。
关键创新:最重要的技术创新点在于引入了反事实证据监督机制,使得模型在训练过程中能够学习到如何更好地利用证据进行判断。这与传统的微调方法有本质区别,后者往往忽视了证据的实际影响。
关键设计:在模型训练中,采用了特定的损失函数来强化证据依赖性,同时设计了多轮消融过程,以确保模型在不同阶段都能有效地利用证据进行判断。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用REAL框架训练的模型在证据依赖性上显著优于标准微调模型,具体表现为在四个事实核查数据集上,模型的证据依赖能力提升了约20%。这一结果表明,强大的事实核查性能可以与较弱的证据依赖性共存,而REAL框架有效促进了二者的结合。
🎯 应用场景
该研究的潜在应用领域包括新闻验证、社交媒体内容审核以及法律文书的真实性检查等。通过提升LLMs的证据依赖性,能够显著提高自动化事实核查系统的可靠性和有效性,进而在信息传播中减少虚假信息的影响。
📄 摘要(原文)
Automatic fact-checking systems assess the veracity of claims given evidence from relevant documents. Large Language Models (LLMs) have demonstrated strong performance in fact-checking due to their general reasoning capabilities. However, it remains unclear whether they faithfully make use of the evidence provided to reach veracity judgments or rely on parametric knowledge. To investigate this, we introduce Fact-Ablated Evaluation (FAE), a new evaluation framework that iteratively ablates the cited evidence to assess whether LLMs revise their predictions accordingly. Our empirical results show that current off-the-shelf LLMs as fact-checking systems rely more on their parametric knowledge than on the evidence provided. To bridge this gap between prediction accuracy and evidence grounding, we propose REAL (Rigorous Evidence Ablation Learning), a training framework that promotes evidence-dependent verification through counterfactual evidence supervision for the LLM-as-verifier models. Experiments on four fact-checking datasets across different domains demonstrate that models trained with REAL obtain superior evidence-dependent capabilities compared to standard fine-tuned models. Our findings highlight that strong fact-checking performance can still coexist with weak evidence dependency, while REAL encourages veracity predictions to remain more closely tied to the availability of supporting evidence.