DeLIVeR: Decomposed Learning for Information-grounded Veracity Recognition via Reinforced Knowledge Graph Exploration

📄 arXiv: 2607.17935v1 📥 PDF

作者: Cong Hoan Nguyen, Thomas Hoang, Hieu Minh Duong, Long Nguyen

分类: cs.CL, cs.AI

发布日期: 2026-07-20

备注: Accepted to 7th International Conference on Deep Learning Theory and Applications (DeLTA 2026)


💡 一句话要点

提出DeLIVeR以解决自动化事实核查中的查询脆弱性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自动化事实核查 知识图谱 强化学习 信息检索 虚假信息检测 多跳推理 策略优化

📋 核心要点

  1. 现有的自动化事实核查方法在处理复杂查询时存在查询脆弱性,导致检索效果不佳。
  2. DeLIVeR框架通过将证据检索视为强化学习任务,利用规划者LLM分解主张并优化问题集以提高检索精度。
  3. 在LIAR、FEVER和PolitiFact数据集上的实验结果显示,DeLIVeR的F1分数比现有方法提高了10-15%,表现出色。

📝 摘要(中文)

自动化事实核查在大型语言模型(LLMs)中仍然面临挑战,尤其是传统检索系统中的“查询脆弱性”。本文提出了DeLIVeR(信息驱动的真实性识别的分解学习框架),将证据检索视为一种强化战略探索任务。DeLIVeR利用规划者LLM将复杂的主张分解为针对性的问题集,以遍历结构化知识图谱(KGs)以获取高精度证据。我们使用群体相对策略优化(GRPO)优化规划者的策略,并通过奖励系统优先考虑结构多样性和裁决准确性。我们在LIAR、FEVER和PolitiFact上的评估表明,DeLIVeR显著超越了现有的最先进基线,使用Qwen2.5-7B框架达到了83.73、84.57和79.70的峰值F1分数,相比HippoRAG2提升了10-15%。通过转向强化问题规划策略,DeLIVeR有效弥补了多跳推理的差距,并提供了可审计、透明的可验证虚假信息检测路径。

🔬 方法详解

问题定义:本文旨在解决自动化事实核查中的查询脆弱性问题,现有方法在复杂查询的处理上效果不佳,导致证据检索的准确性和效率低下。

核心思路:DeLIVeR框架通过将证据检索视为强化学习任务,利用规划者LLM将复杂的主张分解为针对性的问题集,从而优化检索过程,提高证据的准确性和相关性。

技术框架:该框架主要包括三个模块:规划者LLM、知识图谱遍历和策略优化。规划者LLM负责将复杂主张分解为问题集,知识图谱用于高效检索证据,而策略优化则通过GRPO方法提升检索策略的效果。

关键创新:DeLIVeR的主要创新在于将证据检索视为强化学习任务,并引入了结构多样性和裁决准确性作为奖励机制,从而有效提升了检索的精度和效率。

关键设计:在技术细节上,采用了群体相对策略优化(GRPO)来优化规划者的策略,并设计了特定的奖励系统以鼓励多样性和准确性,确保了检索过程的高效性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在LIAR、FEVER和PolitiFact数据集上的实验结果显示,DeLIVeR框架的F1分数分别达到了83.73、84.57和79.70,较HippoRAG2提升了10-15%。这一显著的性能提升证明了其在自动化事实核查中的有效性。

🎯 应用场景

DeLIVeR框架在自动化事实核查、虚假信息检测及相关领域具有广泛的应用潜力。其高效的证据检索能力和透明的推理过程可以帮助媒体、社交平台及政府机构更好地识别和应对虚假信息,提升信息的真实性和可靠性。

📄 摘要(原文)

Automated fact-checking remains a challenge for Large Language Models (LLMs) due to "query brittleness" in traditional retrieval systems. We propose DeLIVeR (Decomposed Learning for Information-grounded Veracity Recognition), a framework that treats evidence retrieval as a reinforced strategic exploration task. DeLIVeR utilizes a Planner LLM to decompose complex claims into targeted question sets, which are used to traverse structured Knowledge Graphs (KGs) for high-precision evidence. We optimize the Planner's policy using Group Relative Policy Optimization (GRPO) with a reward system prioritizing structural diversity and verdict accuracy. Our evaluation on LIAR, FEVER, and PolitiFact shows that DeLIVeR significantly outperforms state-of-the-art baselines. Using Qwen2.5-7B, our framework achieved peak F1-scores of 83.73, 84.57, and 79.70 respectively, representing a 10-15% improvement over HippoRAG2. By shifting to a reinforced question-planning strategy, DeLIVeR effectively bridges multi-hop reasoning gaps and provides an auditable, transparent path for verifiable misinformation detection.