COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization

📄 arXiv: 2609.11682v1 📥 PDF

作者: Pingchen Lu, Xiangyi Wang, Xiang Li, Jie Mao, Zikun Qu, Junfeng Luo, Yao Shu, Bryan Kian Hsiang Low, Zhongxiang Dai

分类: cs.AI

发布日期: 2026-09-10


💡 一句话要点

提出COBRA-Skills以解决技能优化中的高成本问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 技能优化 上下文赌博 序列优化 智能代理 执行反馈

📋 核心要点

  1. 现有技能优化方法通常需要高昂的执行评估成本和大量的任务数据,限制了其应用范围。
  2. COBRA-Skills通过将技能优化视为预算序列优化,结合上下文赌博引导的优先级分配与技能演化,有效降低了优化成本。
  3. 在六个基准测试中,COBRA-Skills相较于其他方法表现出色,优化成本降低了55%至58%,且仅需50个优化示例。

📝 摘要(中文)

大型语言模型(LLM)代理可以从先前任务经验中提炼出可重用的技能,但现有的技能优化方法通常依赖于高昂的执行评估和大量的任务数据。我们提出了COBRA-Skills,这是一个高效的框架,将技能优化形式化为预算序列优化,针对动态演变的候选空间。COBRA-Skills结合了上下文赌博引导的优先级分配与基于证据的技能演化,选择性地将评估分配给有前景或信息量大的候选,同时根据执行反馈不断优化技能群体。在六个异构代理基准和三个目标模型上,COBRA-Skills在比较方法中始终实现了最强的平均性能,同时相较于SkillOpt减少了55%至58%的优化成本,并且每个基准仅使用50个独特的优化示例。进一步分析表明,COBRA-Skills对代理环境的变化保持稳健,并在目标模型本身用于技能生成和优化时表现有效。

🔬 方法详解

问题定义:现有的技能优化方法在执行评估上成本高昂,并且需要大量的任务数据,导致优化过程效率低下。

核心思路:COBRA-Skills通过预算序列优化的方式,结合上下文赌博引导的优先级分配,选择性地评估有潜力的技能候选,从而降低成本并提高效率。

技术框架:该框架包括两个主要模块:上下文赌博引导的优先级分配模块和基于执行反馈的技能演化模块。前者负责识别和选择有前景的候选技能,后者则根据反馈不断优化技能群体。

关键创新:COBRA-Skills的主要创新在于将上下文赌博策略与技能演化相结合,形成了一种动态优化的能力,显著提高了技能优化的效率和效果。

关键设计:在参数设置上,COBRA-Skills使用了预算限制来控制评估次数,并通过证据驱动的方法来调整技能群体,确保在有限的评估中获得最大的信息增益。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

COBRA-Skills在六个异构代理基准测试中表现优异,平均性能超越其他比较方法,同时优化成本降低了55%至58%。此外,该方法在每个基准中仅需50个独特的优化示例,显示出其高效性和实用性。

🎯 应用场景

COBRA-Skills的研究成果在多个领域具有潜在应用价值,特别是在需要高效技能优化的智能代理系统中,如自动化客服、智能助手和游戏AI等。通过降低技能优化的成本和提高效率,该框架能够加速智能系统的开发与部署,推动相关技术的进步。

📄 摘要(原文)

Large language model (LLM) agents can benefit from reusable skills distilled from prior task experience, yet existing skill optimization methods often rely on costly execution-based evaluation and substantial task data. We introduce \textbf{COBRA-Skills}, an efficient framework that formulates skill optimization as budgeted sequential optimization over a dynamically evolving candidate space. COBRA-Skills couples contextual-bandit-guided prioritization with evidence-grounded skill evolution, selectively allocating evaluations to promising or informative candidates while continually refining the skill population from execution feedback. Across six heterogeneous agent benchmarks and three target models, COBRA-Skills consistently achieves the strongest average performance among compared methods, while reducing optimization cost by 55--58\% relative to SkillOpt and using only 50 unique optimization examples per benchmark. Further analyses show that COBRA-Skills remains robust to changes in the agent harness and performs effectively when the target model itself is used for skill generation and refinement.