REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

📄 arXiv: 2607.20833v1 📥 PDF

作者: Zhensheng Jin, Xin Dai, Zhenghao Liu, Chaojun Xiao, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun

分类: cs.CL

发布日期: 2026-07-23

🔗 代码/项目: GITHUB


💡 一句话要点

提出REFACT以解决长文本推理中的证据不足问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 长文本推理 自适应重述 引用机制 强化学习 问答系统

📋 核心要点

  1. 现有方法在长文本推理中面临证据不足的问题,导致推理轨迹偏离上下文。
  2. REFACT通过自适应地重述引用,训练模型判断何时需要上下文支持,避免不支持的推理。
  3. 实验结果显示,REFACT在长上下文问答上表现优越,减少了token消耗并提高了反事实忠实性。

📝 摘要(中文)

大型语言模型在处理复杂任务时越来越依赖长形式推理,但当证据稀疏、噪声或与参数知识冲突时,其推理轨迹可能偏离提供的上下文。现有的基础方法通常在生成后附加引用或鼓励在推理过程中检索证据,但往往无法确保引用内容足以支持局部推理和最终答案。为此,本文提出了REFACT,一个自适应事实重述引用框架,旨在训练模型决定何时需要上下文基础以及以何种粒度重述源事实。该设计通过将引用转化为支持答案的中间状态,避免了不支持的推理和无差别的事实复制。实验结果表明,REFACT在长上下文问答和反事实忠实性方面有所提升,同时显著减少了token消耗。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在长文本推理中因证据稀疏或噪声导致推理轨迹偏离上下文的问题。现有方法往往无法确保引用内容足以支持局部推理和最终答案,造成推理不准确。

核心思路:REFACT的核心思路是自适应地重述引用,训练模型判断何时需要上下文支持,并以适当的粒度重述源事实。这种设计旨在避免不支持的推理和无差别的事实复制。

技术框架:REFACT采用两阶段的SFT到RL的优化流程,首先通过监督微调(SFT)训练模型,然后利用强化学习(RL)进一步优化。该框架包括引用效用奖励机制,鼓励生成的引用内容形式良好、可追溯且足以支持答案。

关键创新:REFACT的主要创新在于将引用转化为支持答案的中间状态,而不是简单的附加引用。这种方法使得推理过程更加紧凑和有效,避免了无效的推理步骤。

关键设计:在模型训练中,采用了特定的损失函数来优化引用的质量,并设计了奖励机制以确保引用内容的有效性和相关性。模型结构方面,结合了长上下文处理能力和强化学习策略,以提高推理的准确性和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,REFACT在LongBench、LV-Eval和ConFiQA数据集上显著提高了长上下文问答的表现,反事实忠实性也得到了提升。与基线相比,REFACT在token消耗方面减少了显著比例,同时保持了更高的答案承载证据密度。

🎯 应用场景

REFACT的研究成果在长文本问答系统、智能助手和复杂推理任务中具有广泛的应用潜力。通过提高推理的准确性和效率,该框架能够在教育、法律和医疗等领域提供更可靠的支持,帮助用户更好地理解和处理信息。

📄 摘要(原文)

Large language models increasingly rely on long-form reasoning for complex tasks, yet their reasoning traces may drift away from the supplied context when evidence is sparse, noisy, or in conflict with parametric knowledge. Existing grounding methods either attach citations after generation or encourage evidence retrieval inside the trace, but they often do not ensure that cited content is sufficient for the local inference and final answer. We propose REFACT, an adaptive fact-restatement citation framework that trains models to decide when a reasoning step needs contextual grounding and at what granularity source facts should be restated. This design avoids both unsupported inference and indiscriminate fact copying by turning citations into answer-supporting intermediate states. REFACT is optimized with a two-stage SFT-to-RL pipeline in which a citation-utility reward encourages cited facts to be well-formed, source-traceable, and answer-sufficient. Experiments on LongBench, LV-Eval, and ConFiQA show that REFACT improves long-context QA and counterfactual faithfulness while substantially reducing token consumption. Further analysis shows that REFACT preserves more answer-bearing evidence with fewer restated facts, yielding reasoning traces that are denser rather than longer. All code and data are available at https://github.com/NEUIR/REFACT.