DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning
作者: Yu Wang, Ming Fan, Xicheng Zhang, Zhiyong Li, Zhihu Wang, Caiyue Xu, Dahai Hu, Ting Liu
分类: cs.CL, cs.AI
发布日期: 2026-07-21
💡 一句话要点
提出依赖感知中间问答监督以解决复杂推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 复杂推理 中间问答监督 链式思维 自然语言处理 模型训练
📋 核心要点
- 现有方法在复杂推理任务中,往往无法有效利用中间推理过程,导致最终答案的准确性不足。
- 本文提出的DAIS框架通过将教师推理转化为阶段级问答记录,增强了对局部推理的监督能力。
- 在GDPR、AIACT、MedQA和FOLIO等数据集上,DAIS相较于传统方法平均提高了4.2%的最终答案准确性。
📝 摘要(中文)
链式思维(CoT)监督揭示了中间推理过程,但平坦的推理目标通常仅优化单一推理序列,限制了对局部结论如何支持后续决策的监督。本文提出了依赖感知中间问答监督(DAIS),该框架在训练时将过滤后的教师推理转化为阶段级问答记录。每个中间记录基于所需的先前状态预测局部答案,而最终答案记录保持原始任务格式。实验表明,DAIS在多个基准数据集上显著提高了最终答案的准确性。
🔬 方法详解
问题定义:本文旨在解决复杂推理任务中,现有方法对中间推理过程的监督不足,导致最终答案准确性低下的问题。现有的平坦推理目标无法有效指导局部结论如何支持后续决策。
核心思路:DAIS框架通过将教师推理转化为阶段级问答记录,使每个中间记录基于先前状态进行局部答案预测,从而提供更有效的监督信号。这样的设计旨在增强模型对推理过程的理解和依赖。
技术框架:DAIS的整体架构包括两个主要模块:首先是过滤教师推理以生成中间问答记录,其次是将这些记录与最终答案结合,保持原始任务格式。训练过程中,模型通过阶段级记录进行学习,最终输出符合任务要求的答案。
关键创新:DAIS的核心创新在于引入依赖感知的中间问答监督,这与传统的单一推理序列优化方法有本质区别。通过阶段级的局部答案预测,DAIS能够更好地捕捉推理过程中的依赖关系。
关键设计:在DAIS中,关键设计包括有效的状态条件设置和损失函数的优化,确保模型在训练过程中能够充分利用中间记录。此外,网络结构经过精心设计,以支持阶段级的推理过程。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DAIS在政策合规基准上相较于最强的非DAIS基线,取得了最高5.6%的提升,平均提升为4.2%。这些结果表明,依赖感知的中间问答监督显著增强了模型的推理能力。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能问答系统和复杂决策支持系统。通过增强模型对推理过程的理解,DAIS能够在医疗、法律和教育等领域提供更准确的决策支持,具有重要的实际价值和未来影响。
📄 摘要(原文)
Chain-of-thought (CoT) supervision exposes intermediate rationales, but flat rationale targets usually optimize a single reasoning sequence and provide limited supervision on how local conclusions should support later decisions. We introduce Dependency-Aware Intermediate QA Supervision (DAIS), a training-time framework that converts filtered teacher rationales into stage-level QA records. Each intermediate record predicts a local answer conditioned on the previous states needed for that decision, while the final-answer record keeps the original task format; evaluation therefore uses only the original input and optional context. Across GDPR, AIACT, MedQA, and FOLIO with multiple Qwen backbones, DAIS improves average final-answer accuracy over answer-only, flat chain-of-thought, and independent-QA baselines. On policy-compliance benchmarks, it achieves a largest gain of 5.6% and an average gain of 4.2% over the strongest non-DAIS baseline. Controlled ablations show that valid previous-state conditioning contributes beyond longer targets or additional intermediate text, supporting dependency-conditioned intermediate QA as a lightweight auxiliary supervision signal for standard final-answer inference.