UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation
作者: Songjun Tu, Chengdong Xu, Qichao Zhang, Yiwen Ma, Yaocheng Zhang, Linjing Li, Dong Li, Xiangyuan Lan, Dongbin Zhao
分类: cs.AI, cs.CL
发布日期: 2026-07-20
💡 一句话要点
提出UCOB框架以提升强化学习中的技能利用与演化
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自主强化学习 技能记忆 自蒸馏 信用感知 动态调整 任务适应性 模型优化
📋 核心要点
- 现有方法在技能记忆的使用上存在局限,无法有效处理技能在不同状态下的适用性。
- UCOB框架通过信用感知的在线双向自蒸馏,动态调整技能的使用,提升学习效果。
- 实验结果显示,UCOB在多个任务上显著优于现有基线,验证了其有效性和适应性。
📝 摘要(中文)
技能记忆可以通过重用过去的经验作为文本指导来改善自主强化学习,但检索到的技能并非总是可靠的:它们可能在某些状态下有帮助,而在其他状态下则可能误导相同的策略。这使得常见的特权教师假设变得脆弱,即技能条件提示可以被视为无技能提示的固定教师。我们提出了UCOB框架,通过信用感知的在线双向自蒸馏来学习利用和演化自主技能。UCOB将技能条件和无技能提示视为同一模型的两种在线上下文视图,在相同任务和锚定状态下比较它们的回报,并使用回报更高的视图作为局部教师。这一局部信用信号内化了有用的技能条件行为,纠正了误导性的技能使用,并指导任务/状态技能记忆更新、效用感知检索和反思自训练。实验结果表明,UCOB在多个自主任务上超越了无技能强化学习、技能记忆基线和自蒸馏方法,在ALFWorld和WebShop上分别获得了23.5和18.0的性能提升。
🔬 方法详解
问题定义:本论文旨在解决技能记忆在自主强化学习中的不可靠性问题,现有方法在不同状态下对技能的适用性判断存在不足,导致学习效果不佳。
核心思路:UCOB框架通过将技能条件提示和无技能提示视为同一模型的两种上下文视图,利用信用感知机制动态调整技能使用,确保更高效的学习和技能演化。
技术框架:UCOB的整体架构包括两个主要模块:技能条件提示和无技能提示的双向自蒸馏,通过比较两者在相同任务和状态下的回报,选择回报更高的视图作为局部教师。
关键创新:UCOB的创新在于其信用感知的在线双向自蒸馏机制,能够实时纠正误导性的技能使用,并有效指导技能记忆的更新,与传统方法相比,提升了技能的适用性和学习效率。
关键设计:在设计上,UCOB采用了特定的损失函数来平衡技能条件和无技能提示的学习,确保模型能够在不同环境中持续适应,同时保持训练开销的适度。
🖼️ 关键图片
📊 实验亮点
UCOB在多个自主任务上表现出色,尤其是在ALFWorld和WebShop任务中,分别实现了23.5和18.0的性能提升,超越了现有的无技能强化学习、技能记忆基线和自蒸馏方法,验证了其有效性和创新性。
🎯 应用场景
UCOB框架具有广泛的潜在应用,特别是在需要灵活应对复杂环境的自主系统中,如机器人导航、智能助手和游戏AI等领域。其动态调整技能使用的能力将显著提升这些系统的智能水平和适应能力,推动相关技术的发展与应用。
📄 摘要(原文)
Skill memories can improve agentic reinforcement learning by reusing past experience as textual guidance, but retrieved skills are not oracular: they may help in one state while misleading the same policy in another. This makes the common privileged-teacher assumption fragile, namely that a skill-conditioned prompt can be treated as a fixed teacher for the no-skill prompt. We introduce UCOB, a framework for learning to utilize and evolve agentic skills via credit-aware on-policy bidirectional self-distillation. UCOB treats skill-conditioned and no-skill prompts as two on-policy context views of the same model, compares their return-to-go within the same task and anchor state, and uses the higher-return view as the local teacher. This local credit signal internalizes useful skill-conditioned behavior, corrects misleading skill usage, and guides task/state skill memory updates, utility-aware retrieval, and reflection self-training. Experiments on agentic tasks, including ALFWorld, WebShop, and Search-QA, show that UCOB outperforms skill-free RL, skill-memory baselines, and self-distillation methods across model scales, with up to 23.5 and 18.0 point gains over SOTA baselines on ALFWorld and WebShop. Ablations and analyses further validate its core mechanisms, continual adaptation across environments, and modest training overhead. Code is available atthis https URL.