TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

📄 arXiv: 2607.05804v1 📥 PDF

作者: Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen

分类: cs.AI, cs.CL

发布日期: 2026-07-07


💡 一句话要点

提出TurnOPD以解决长时间跨度代理训练中的低效问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 长时间跨度代理训练 在线蒸馏 转折级预算 自适应回放 深层决策训练

📋 核心要点

  1. 现有的在线蒸馏方法在长时间跨度的代理任务中效率不足,尤其是在尾部转折和深层决策训练方面。
  2. TurnOPD通过引入转折级预算策略,采用自适应回放深度和逐步转折归一化损失预算来优化在线蒸馏过程。
  3. 在ALFWorld、WebShop和Multi-Hop Search等任务中,TurnOPD在相同的训练时间预算下实现了更高的验证准确率,提升了训练效率。

📝 摘要(中文)

在这篇论文中,作者提出了TurnOPD,一种针对长时间跨度代理训练的高效在线蒸馏方法。现有的在线蒸馏方法在长时间任务中存在效率低下的问题,主要体现在两个方面:一是完整的轨迹回放在尾部转折上浪费了大量资源,二是轨迹级的KL目标过于集中于浅层标记,导致深层决策转折训练不足。TurnOPD通过引入转折级预算策略,利用自适应回放深度和逐步转折归一化损失预算来解决这些问题。实验结果表明,TurnOPD在相同的训练时间预算下,显著提高了验证准确率,超越了传统的在线蒸馏方法。

🔬 方法详解

问题定义:论文要解决的问题是现有在线蒸馏方法在长时间跨度任务中的低效性,具体表现为尾部转折的资源浪费和深层决策训练不足。

核心思路:TurnOPD的核心思路是通过转折级的预算策略来提高在线蒸馏的效率,确保在训练过程中更好地分配资源和关注深层决策。

技术框架:TurnOPD的整体架构包括两个主要模块:自适应回放深度预算和逐步转折归一化损失预算,前者根据转折统计信息动态调整回放长度,后者则在训练过程中逐步调整KL损失的权重。

关键创新:TurnOPD的创新点在于将预算策略引入在线蒸馏过程,区别于传统方法的全局损失计算,能够更有效地处理长时间跨度的决策问题。

关键设计:在设计中,采用了基于探测的转折统计来指导回放深度的调整,并在损失函数中实现了从标记级到转折级的平滑过渡,以确保深层决策的有效训练。

🖼️ 关键图片

img_0
img_1

📊 实验亮点

实验结果显示,TurnOPD在ALFWorld、WebShop和Multi-Hop Search等任务上取得了显著的性能提升。在相同的训练时间预算下,TurnOPD的验证准确率超过了传统的在线蒸馏方法,展示了其在效率和准确性上的优势。

🎯 应用场景

TurnOPD的研究成果在长时间跨度的代理任务中具有广泛的应用潜力,尤其是在需要高效决策和资源管理的场景,如智能机器人、自动驾驶和复杂的对话系统等。未来,随着技术的进一步发展,TurnOPD有望推动更高效的智能体训练方法,提升人工智能系统的决策能力和响应速度。

📄 摘要(原文)

On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.