EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

📄 arXiv: 2607.23955v1 📥 PDF

作者: Xiao Ma, Zhiquan Hu, Yi Wei, Chenchen Zhao, Yijun Chen, Jicheng Zhao, Yuming Li Chuang Dai

分类: cs.AI

发布日期: 2026-07-27


💡 一句话要点

提出EviBack以解决多轮搜索中的信号缺失问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 多轮搜索 证据约束 教师回退 开放域问答 自动化管道

📋 核心要点

  1. 现有的强化学习方法在多轮搜索中存在全零回放组缺乏比较信号的问题,可能导致有用搜索行为的丢失。
  2. EviBack通过证据约束的教师回退机制,为全零回放组提供辅助监督,确保可验证的Actor奖励不被覆盖。
  3. 在七个开放域QA基准和三个Qwen3规模的实验中,EviBack在F1和有效答案率上均有显著提升。

📝 摘要(中文)

强化学习使得Agentic RAG系统能够通过可验证的结果奖励学习多轮搜索,但全零回放组缺乏比较信号,可能掩盖有用的搜索行为。本文提出EviBack,一种证据约束的教师回退方法,为此类组提供辅助监督,同时保留可验证的Actor奖励。该方法将证据评估与答案优化分离,防止参考答案覆盖证据不足的判断。通过全自动的GPT-5.5辅助APE管道,EviBack显著提升了下游F1和有效答案率,同时减少了搜索、重复查询和强制终止的情况。

🔬 方法详解

问题定义:本文旨在解决现有强化学习方法在多轮搜索中由于全零回放组缺乏比较信号而导致的有效搜索行为丢失的问题。现有方法未能充分利用可验证的结果奖励,影响了学习效果。

核心思路:EviBack的核心思路是通过证据约束的教师回退机制,为全零回放组提供辅助监督,同时确保Actor奖励的可验证性。通过将证据评估与答案优化分离,避免了参考答案对证据不足判断的干扰。

技术框架:EviBack采用全自动的GPT-5.5辅助APE管道,首先从手动编写的单提示双任务教师开始,自动划分和标记回放数据,进行消融、任务分解、评估和选择,最终生成一个门控的两阶段教师。

关键创新:EviBack的主要创新在于引入了证据约束的教师回退机制,这一机制与现有方法的本质区别在于它能够有效地提供辅助监督,同时保持Actor奖励的可验证性。

关键设计:在设计中,EviBack使用了自动化的数据划分和标记方法,确保了回放数据的高效利用,并通过消融实验优化了任务分解和评估流程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,EviBack在七个开放域QA基准上相较于Search-R1的F1得分有显著提升,同时在单跳和多跳的宏F1上均有所提高,展示了其在有效答案率和搜索效率上的优势。

🎯 应用场景

EviBack的研究成果在开放域问答系统、智能搜索引擎和对话系统等领域具有广泛的应用潜力。通过提升多轮搜索的有效性和准确性,该方法能够为用户提供更为精准的信息检索服务,进而推动智能助手和自动化客服等技术的发展。

📄 摘要(原文)

Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hide useful search behavior. We present EviBack, an evidence- constrained Teacher backoff that supplies auxiliary super- vision to such groups while preserving verifiable Actor re- wards. It separates evidence assessment from answer refine- ment, preventing reference answers from overriding evidence- insufficiency judgments. A fully automated, end-to-end GPT- 5.5-assisted APE pipeline starts from a manually authored single-prompt dual-task Teacher, automatically partitions and labels rollout data, and performs ablation, task decomposition, evaluation, and selection to produce a gated two-stage Teacher. Compared with the manual design, the resulting Teacher im- proves downstream F1 and valid-answer rate while reduc- ing search, duplicate queries, and forced termination. Across seven open-domain QA benchmarks and three Qwen3 scales, EviBack improves F1 over Search-R1 and raises both single- and multi-hop macro F1. We guarantee that the code will be made publicly available at a later stage.