What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents
作者: Qinghua Xing, Yinda Chen, Yaping Jin, Zhenhe Wu, Bohan Lin, Hang Zhou, Xinghao Chen, Hanting Chen, Zhiwei Xiong
分类: cs.CL
发布日期: 2026-07-20
💡 一句话要点
提出成本意识的技能重写方法以优化语言模型代理的性能
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 技能重写 语言模型 成本优化 信息保留 经济视角 操作知识工程 性能评估
📋 核心要点
- 现有技能重写方法往往忽视了成本与质量之间的权衡,导致代理性能下降。
- 论文提出了一种经济视角的技能重写框架,通过信息保留策略优化技能结构。
- 实验结果显示,所提方法在多个任务上有效降低了成本,同时保持了验证器的质量。
📝 摘要(中文)
大型语言模型代理日益依赖技能,这些技能是编码工作流程、工具使用、实现模式、验证检查和领域规则的可重用程序文档。技能重写通常被视为提示压缩,但较短的技能可能通过去除稀疏的操作锚点而使代理变得更昂贵,从而影响探索、调试和恢复。本文通过经济视角研究技能重写,构建了一个受控框架,分析技能结构,采用信息保留策略重写技能,并在固定任务指令、环境和验证器下评估重写效果。实验结果表明,不同策略在质量与成本之间存在明显的权衡,学习的策略在主要评估中将总成本降低了7.0%,下游代理令牌成本降低了6.0%。
🔬 方法详解
问题定义:本文旨在解决技能重写过程中成本与质量的权衡问题。现有方法往往将技能重写视为简单的提示压缩,忽略了操作锚点的重要性,导致代理在探索和调试时的性能下降。
核心思路:论文提出通过经济视角分析技能重写,采用信息保留策略来优化技能结构,从而在保证质量的前提下降低成本。这样的设计旨在平衡技能的简洁性与操作的复杂性。
技术框架:整体框架包括技能结构分析、技能重写过程和重写效果评估三个主要模块。首先对技能进行结构化分析,然后应用信息保留策略进行重写,最后在固定的任务指令和环境下评估重写后的效果。
关键创新:论文的主要创新在于将技能设计视为一种成本意识的操作知识工程,而非单纯的提示压缩。这一视角使得技能重写不仅关注简化,还关注如何在不同任务中优化性能。
关键设计:在技能重写过程中,采用了API/code锚定、工作流保护和规则/公式锚定等策略,这些策略根据不同任务的需求进行调整,确保在降低成本的同时保持验证器的质量。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提出的学习策略在主要评估中将总成本降低了7.0%,下游代理令牌成本降低了6.0%。在跨模型转移中,成本降低幅度更大,平均分别为14.7%和13.7%,同时保持了验证器的质量。
🎯 应用场景
该研究的潜在应用领域包括智能助手、自动化工作流程和复杂任务的执行等。通过优化技能重写,能够显著提高语言模型代理的效率和经济性,未来可能在商业和工业应用中发挥重要作用。
📄 摘要(原文)
Large language model agents increasingly rely on skills: reusable procedural documents encoding workflows, tool use, implementation patterns, validation checks, and domain rules. Skill rewriting is often treated as prompt compression, but shorter skills can make agents more expensive by removing sparse operational anchors that prevent exploration, debugging, and recovery. We study skill rewriting through this economic lens. Our controlled framework profiles skill structure, rewrites skills using information-preservation strategies, and evaluates the rewrites under fixed task instructions, environments, and verifiers. Experiments on SkillsBench reveal distinct quality--cost trade-offs across strategies: API/code anchoring, workflow guarding, and rule/formula anchoring benefit different task families, with no universally dominant template. In the main held-out evaluation, the learned policy reduces total cost by 7.0% and downstream agent-token cost by 6.0%; in frozen cross-model transfer, the corresponding reductions average 14.7% and 13.7%, while verifier quality is preserved. These results position skill design as cost-aware operational knowledge engineering rather than prompt compression. Resources:this https URL.