CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution

📄 arXiv: 2609.04865v1 📥 PDF

作者: Jinyuan Feng, Dongmin Li, Yiqun Chen, Yang Gao, Xing Chen, Huimu Wang, Zhiqiang Pu

分类: cs.AI

发布日期: 2026-09-04

🔗 代码/项目: GITHUB


💡 一句话要点

提出CoSkill框架以解决技能演化与策略优化的耦合问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 技能演化 元技能代理 推理代理 多代理系统 样本效率 智能系统

📋 核心要点

  1. 现有技能库方法将技能演化与策略优化解耦,限制了技能的灵活演化和推理代理的共同适应。
  2. CoSkill框架通过将元技能工作流转化为可学习的元技能代理,促进推理代理与元技能代理的联合训练。
  3. 在ALFWorld和WebShop上的实验结果显示,CoSkill的成功率显著高于传统方法,提升幅度分别为3.5和6.2个百分点。

📝 摘要(中文)

技能库通过重用程序知识提高了代理强化学习的样本效率。然而,现有方法存在结构性缺陷:要么将技能演化与策略优化解耦,要么将元技能实例化为固定工作流,限制了技能的灵活演化及其与推理代理的共同适应。为了解决这些局限性,本文提出了CoSkill,一个统一的多代理强化学习框架,将静态的元技能工作流重构为可学习的元技能代理,并与推理代理共同训练。通过将推理代理与元技能代理建模为共享单一骨干的合作团队,CoSkill实现了端到端的共同适应。实验结果表明,CoSkill在ALFWorld和WebShop上显著优于先前的基于技能和强化学习的基线,成功率分别达到98.4%和90.6%。

🔬 方法详解

问题定义:本文旨在解决现有技能库方法在技能演化与策略优化之间的耦合问题,导致技能灵活性不足及推理代理适应性差的痛点。

核心思路:提出CoSkill框架,将静态的元技能工作流转化为可学习的元技能代理,并与推理代理共同训练,以实现技能的灵活演化和共同适应。

技术框架:CoSkill框架由推理代理和元技能代理组成,二者共享一个骨干网络。推理代理根据检索到的任务技能和子集中的步骤技能来调整其行为,而元技能代理则根据推理代理的任务表现来优化步骤技能。

关键创新:CoSkill的创新在于将元技能视为可学习的代理,而非固定工作流,从而实现了端到端的共同适应,显著提升了技能的演化能力。

关键设计:在设计中,采用了共享骨干网络的结构,设置了适应性损失函数以优化推理和元技能代理的协作效果,具体参数设置和网络结构细节在实验部分进行了详细说明。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CoSkill在ALFWorld和WebShop上的成功率分别达到98.4%和90.6%,相比于传统技能基线提升了3.5和6.2个百分点,展现出卓越的早期样本效率和整体性能。

🎯 应用场景

CoSkill框架具有广泛的应用潜力,尤其在需要灵活技能演化的复杂任务中,如机器人控制、智能助手和自动化系统等领域。其创新的联合训练方法能够提升代理的适应能力和任务执行效率,未来可能推动智能系统的进一步发展。

📄 摘要(原文)

Skill libraries improve the sample efficiency of agentic reinforcement learning (RL) by enabling large language model (LLM) agents to reuse procedural knowledge. Yet existing paradigms exhibit structural shortcomings: they either decouple skill evolution from policy optimization or instantiate meta-skills as fixed workflows. Both treat skills as passive objects to be managed, limiting the flexible evolution of skills and their co-adaptation with the reasoning agent. To address the limitations, we propose CoSkill, a unified multi-agent RL framework that recasts the static meta-skill workflow as a learnable Meta-Skill Agent and jointly trains it with a Reasoning Agent over a hierarchical skill library. By modeling the Reasoning and Meta-Skill Agents as a cooperative team sharing a single backbone, CoSkill enables end-to-end co-adaptation: the Reasoning Agent conditions its actions on a retrieved task skill and step skills selected from its child set, while its task performance guides the Meta-Skill Agent in refining those step skills. Experiments on ALFWorld and WebShop show that CoSkill substantially outperforms prior skill-based and RL baselines, achieving success rates of 98.4% and 90.6%, respectively (+3.5 and +6.2 pp). As shown in Figure 1, CoSkill achieves superior early-stage sample efficiency, asymptotic performance, and wall-clock efficiency. Our code is available at https://github.com/jinyuan-cookie/CoSkill.