RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources
作者: Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo
分类: cs.SE, cs.AI
发布日期: 2026-07-20
💡 一句话要点
提出RESOURCE2SKILL框架以从多模态资源中提炼可执行代理技能
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态资源 技能提炼 层次化组织 可执行技能 软件代理 智能化应用 视频理解 在线学习
📋 核心要点
- 现有技能库多为手工编写或文本中心,未能充分利用多模态资源如视频和文档,限制了代理技能的多样性和实用性。
- RESOURCE2SKILL框架通过提炼多模态资源,构建层次化的技能维基,结合文本、代码和视觉示例,增强了技能的可执行性和适用性。
- 在七个创作领域的实验中,RESOURCE2SKILL显著提升了代理的性能,平均得分提高11.9个百分点,并在大多数对比实验中表现优异。
📝 摘要(中文)
技能是软件代理的重要抽象,将人类和代理的经验转化为可重用的程序知识。然而,现有的技能库大多是手工编写的、以文本为中心的,或是从代理轨迹中派生的,导致教程视频等多模态人类资源未被充分利用。本文提出了RESOURCE2SKILL框架,能够将教程视频、文档、文章和参考文献等多模态资源提炼为可执行的技能,并将这些技能组织为层次化的多模态技能维基。该设计保留了来自不同资源的互补信号,提升了代理在七个实际创作领域的表现,平均得分提高了11.9个百分点,并在28个主要聚合模型-领域单元中超越了强基线。
🔬 方法详解
问题定义:本论文旨在解决现有技能库的局限性,特别是未能有效利用多模态人类资源(如视频和文档)的问题。现有方法往往依赖于手工编写或代理轨迹,导致技能的多样性和实用性不足。
核心思路:RESOURCE2SKILL框架的核心思路是将多模态资源提炼为可执行的技能,并将其组织为层次化的技能维基。通过结合不同类型的资源,框架能够保留互补信号,从而提升技能的可用性和执行效果。
技术框架:该框架包括多个模块,首先是资源提炼模块,将视频、文档和代码等多模态资源转化为技能;其次是技能组织模块,将提炼的技能以层次化方式存储;最后是技能检索与组合模块,代理在推理时可从维基中检索相关技能并进行组合。
关键创新:RESOURCE2SKILL的主要创新在于其多模态技能格式和层次化组织方式,能够有效整合来自不同资源的信号,与传统的文本中心技能库形成鲜明对比。
关键设计:在设计中,框架采用了多种参数设置和选择策略,以确保技能的多样性和适用性。同时,在线获取新技能的能力使得代理能够在运行时不断扩展其技能库。
🖼️ 关键图片
📊 实验亮点
在七个实际创作领域的实验中,RESOURCE2SKILL框架的平均得分提高了11.9个百分点,且在28个主要聚合模型-领域单元中超越了强基线,显示出其在技能提炼和应用方面的显著优势。
🎯 应用场景
RESOURCE2SKILL框架具有广泛的应用潜力,适用于需要自动化和智能化的领域,如机器人控制、虚拟助手和教育技术等。通过有效提炼和组织技能,该框架能够提升软件代理的智能水平,使其在复杂任务中表现更为出色,未来可能推动智能代理的普及和应用。
📄 摘要(原文)
Skills are a useful abstraction for software agents, turning human and agent experience into reusable procedural knowledge. Yet existing skill libraries are mostly hand-written, text-centric, or derived from agent traces, leaving tutorial videos and other multimodal human resources largely underused. We present RESOURCE2SKILL, a framework that distills multimodal resources, including tutorial videos, repositories, articles, and reference artifacts, into executable skills for software agents. RESOURCE2SKILL organizes these skills as a hierarchical multimodal Skill Wiki, where each entry combines structured text, code, visual examples, metadata, and provenance. This design preserves complementary signals from different resources: videos capture temporal operations and visual effects, code captures executable tool patterns, and articles or artifacts provide conceptual and stylistic grounding. At inference time, agents retrieve and compose relevant skills from the wiki; when coverage is insufficient, the same construction operator can acquire new skills online. Across seven practical authoring domains, RESOURCE2SKILL improves average overall score by +11.9 percentage points over no-skill agents and outperforms strong harness baselines in 26 of 28 main-aggregate model-domain cells. Ablations confirm the value of multimodal skill format, hierarchical organization, source diversity, selection strategy, and online acquisition.