SteP: Stacked LLM Policies for Web Actions
作者: Paloma Sodhi, S. R. K. Branavan, Yoav Artzi, Ryan McDonald
分类: cs.LG
发布日期: 2023-10-05 (更新: 2024-08-08)
备注: Accepted at Conference on Language Modeling (COLM) 2024. 30 pages, 15 figures
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出SteP以解决大规模网络任务的动态控制问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 动态控制 马尔可夫决策过程 策略组合 网络任务 自动化执行 用户体验
📋 核心要点
- 现有方法在处理网络任务时面临组合性大和接口多样性等挑战,导致行为控制复杂且易出错。
- SteP通过定义马尔可夫决策过程,使用动态堆叠策略来适应不同任务的复杂性,解决了控制交接的问题。
- 实验结果表明,SteP在WebArena上性能提升14.9%至33.5%,在MiniWoB++上则在数据使用上显著优于以往工作。
📝 摘要(中文)
在网络上执行任务对大型语言模型(LLMs)提出了基本挑战,包括组合性大的开放世界任务和网络接口的多样性。仅仅通过指定一个大型提示来处理所有可能的行为和状态是极其复杂的,且会导致无关行为之间的泄漏。通过将任务分解为不同的策略可以解决这一挑战,但需要仔细处理策略之间的控制交接。我们提出了堆叠LLM策略(SteP),一种动态组合策略以解决多样化网络任务的方法。SteP定义了一个马尔可夫决策过程,其中状态是表示控制状态的策略堆栈,即策略调用链。与传统方法的静态层次结构不同,SteP能够根据任务的复杂性进行动态控制。我们在多个基准和网络环境中评估SteP,包括WebArena、MiniWoB++和CRM。在WebArena上,SteP相较于使用GPT-4策略的最先进技术提高了14.9%至33.5%,而在MiniWoB++上,SteP在使用显著更少数据的情况下与之前的工作具有竞争力。
🔬 方法详解
问题定义:本论文旨在解决大型语言模型在执行网络任务时面临的控制复杂性问题,现有方法往往依赖静态层次结构,难以适应任务的多样性和复杂性。
核心思路:论文提出的SteP方法通过动态组合多个策略,形成一个策略堆栈,能够根据任务需求灵活调整控制流程,从而有效应对不同的网络任务。
技术框架:SteP的整体架构包括策略堆栈的构建、状态管理和动态控制模块。每个策略负责特定的任务,系统根据当前状态选择合适的策略进行调用。
关键创新:SteP的主要创新在于其动态控制能力,打破了传统方法的静态限制,使得策略可以根据任务复杂性进行实时调整,从而提高了任务执行的灵活性和准确性。
关键设计:在设计上,SteP使用了马尔可夫决策过程来定义状态和策略堆栈,确保策略之间的有效交接。同时,采用了优化的损失函数和策略选择机制,以提高模型的学习效率和执行效果。
🖼️ 关键图片
📊 实验亮点
在实验中,SteP在WebArena上相较于使用GPT-4策略的最先进技术提升了14.9%至33.5%的性能,而在MiniWoB++上则在使用显著更少数据的情况下表现出竞争力,验证了其有效性和优势。
🎯 应用场景
该研究的潜在应用领域包括自动化客服、在线购物助手和信息检索等场景。通过提高大型语言模型在复杂网络环境中的任务执行能力,SteP能够显著提升用户体验和操作效率,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Performing tasks on the web presents fundamental challenges to large language models (LLMs), including combinatorially large open-world tasks and variations across web interfaces. Simply specifying a large prompt to handle all possible behaviors and states is extremely complex, and results in behavior leaks between unrelated behaviors. Decomposition to distinct policies can address this challenge, but requires carefully handing off control between policies. We propose Stacked LLM Policies for Web Actions (SteP), an approach to dynamically compose policies to solve a diverse set of web tasks. SteP defines a Markov Decision Process where the state is a stack of policies representing the control state, i.e., the chain of policy calls. Unlike traditional methods that are restricted to static hierarchies, SteP enables dynamic control that adapts to the complexity of the task. We evaluate SteP against multiple baselines and web environments including WebArena, MiniWoB++, and a CRM. On WebArena, SteP improves (14.9\% to 33.5\%) over SOTA that use GPT-4 policies, while on MiniWob++, SteP is competitive with prior works while using significantly less data. Our code and data are available at https://asappresearch.github.io/webagents-step.