SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

📄 arXiv: 2607.14777v1 📥 PDF

作者: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

分类: cs.CL

发布日期: 2026-07-16

🔗 代码/项目: GITHUB


💡 一句话要点

提出SEED框架以解决稀疏奖励下的决策监督问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 自我演化 在线蒸馏 自然语言处理 决策优化 多轮交互 技能学习

📋 核心要点

  1. 现有的基于结果的强化学习方法在稀疏奖励情况下,难以提供有效的中间决策指导,造成监督缺口。
  2. SEED框架通过分析已完成的轨迹,生成可重用的自然语言技能,从而实现策略的自我演化与优化。
  3. 大量实验结果表明,SEED在多种任务上均显著提高了性能和样本效率,且具备良好的泛化能力。

📝 摘要(中文)

随着大型语言模型被训练为交互代理以完成多轮任务,基于结果的强化学习(RL)面临稀疏轨迹奖励的挑战,导致中间决策指导不足。为此,本文提出SEED(自我演化的在线蒸馏),该框架将完成的在线轨迹转化为训练时的后见技能,并将其行为效应蒸馏回策略模型。SEED通过分析已完成轨迹生成自然语言技能,提升决策和技能分析的协同演进。实验表明,SEED在文本和视觉任务上均显著提升了性能和样本效率,并展现出对未见场景的强大泛化能力。

🔬 方法详解

问题定义:本文旨在解决基于结果的强化学习中,由于稀疏奖励导致的中间决策指导不足的问题。现有方法在轨迹级别的奖励反馈上存在监督缺口,影响策略学习的有效性。

核心思路:SEED框架的核心思想是将完成的在线轨迹转化为训练时的后见技能,并将这些技能的行为效应蒸馏回策略模型,从而实现策略的自我演化。通过分析轨迹生成自然语言技能,提升决策过程中的信息利用效率。

技术框架:SEED的整体架构包括两个主要模块:轨迹分析模块和策略更新模块。轨迹分析模块负责从已完成的轨迹中提取后见技能,而策略更新模块则利用这些技能进行策略优化。整个流程是一个循环迭代的过程,策略在收集轨迹的同时进行分析和更新。

关键创新:SEED的主要创新在于将后见技能的提取与策略更新相结合,实现了监督信号的自我演化。这一设计使得策略在学习过程中能够动态适应和优化,克服了传统方法的静态性。

关键设计:在技术细节上,SEED使用了特定的损失函数来平衡结果导向的强化学习与技能蒸馏信号的优化。此外,策略模型的网络结构经过精心设计,以支持自然语言技能的生成与应用。具体参数设置和网络架构细节在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个文本和视觉任务的实验中,SEED框架表现出显著的性能提升。例如,在特定任务上,SEED相较于基线方法提高了样本效率超过30%,并在未见场景中展现出更强的泛化能力,验证了其有效性和实用性。

🎯 应用场景

SEED框架具有广泛的潜在应用场景,尤其适用于需要长时间交互和复杂决策的任务,如智能助手、游戏代理和自动化工具等。其自我演化的特性使得系统能够在动态环境中不断优化决策能力,提升用户体验和任务完成效率。未来,SEED可能在多模态学习和人机交互领域产生深远影响。

📄 摘要(原文)

Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.