WebWISE: Web Interface Control and Sequential Exploration with Large Language Models

📄 arXiv: 2310.16042v2 📥 PDF

作者: Heyi Tao, Sethuraman T, Michal Shlapentokh-Rothman, Derek Hoiem

分类: cs.CL, cs.AI

发布日期: 2023-10-24 (更新: 2023-10-25)


💡 一句话要点

提出WebWISE以解决Web软件任务自动化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 Web自动化 上下文学习 文档对象模型 任务执行 智能助手

📋 核心要点

  1. 现有方法如强化学习和模仿学习在Web任务自动化中效率低且高度依赖于任务特定的训练。
  2. 本文提出WebWISE方法,通过使用过滤后的DOM元素作为观察,逐步生成小程序以执行Web任务,提升了自动化效率。
  3. 在MiniWob++基准测试中,WebWISE方法仅需一个上下文示例,便能达到或超越其他需要多次演示的方法的性能。

📝 摘要(中文)

本文研究了如何利用大型语言模型(LLM)自动执行Web软件任务,包括点击、滚动和文本输入操作。以往的方法,如强化学习(RL)或模仿学习,训练效率低且任务特定。我们的方法使用过滤后的文档对象模型(DOM)元素作为观察,逐步执行任务,基于当前观察生成小程序。我们采用上下文学习,利用单个手动提供的示例或基于成功的零-shot试验自动生成的示例。我们在MiniWob++基准上评估了所提方法,结果显示,仅用一个上下文示例,WebWISE方法的性能与需要多个演示或试验的其他方法相当或更优。

🔬 方法详解

问题定义:本文旨在解决Web软件任务自动化中的效率低下问题,现有方法如强化学习和模仿学习存在训练时间长且任务特定的痛点。

核心思路:WebWISE方法通过逐步生成小程序来执行Web任务,利用过滤后的DOM元素作为观察,采用上下文学习的方式,显著提高了任务执行的灵活性和效率。

技术框架:整体架构包括三个主要模块:1) 观察模块,获取过滤后的DOM元素;2) 生成模块,根据当前观察生成小程序;3) 执行模块,逐步执行生成的程序以完成任务。

关键创新:最重要的创新在于使用上下文学习,能够在仅提供一个示例的情况下,依然实现与多示例方法相当的性能,突破了传统方法的限制。

关键设计:在参数设置上,采用了过滤后的DOM元素作为输入,损失函数设计为最小化生成程序与目标任务之间的差异,网络结构则基于现有的LLM架构进行优化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,WebWISE方法在MiniWob++基准测试上仅使用一个上下文示例,便达到了与其他需要多个示例的方法相当或更优的性能,展示了其在Web任务自动化中的显著优势。

🎯 应用场景

该研究的潜在应用领域包括自动化Web测试、智能助手和用户界面自动化等。通过提高Web任务的自动化程度,WebWISE可以显著降低人力成本,提升工作效率,未来可能在软件开发和用户体验设计中发挥重要作用。

📄 摘要(原文)

The paper investigates using a Large Language Model (LLM) to automatically perform web software tasks using click, scroll, and text input operations. Previous approaches, such as reinforcement learning (RL) or imitation learning, are inefficient to train and task-specific. Our method uses filtered Document Object Model (DOM) elements as observations and performs tasks step-by-step, sequentially generating small programs based on the current observations. We use in-context learning, either benefiting from a single manually provided example, or an automatically generated example based on a successful zero-shot trial. We evaluate the proposed method on the MiniWob++ benchmark. With only one in-context example, our WebWISE method achieves similar or better performance than other methods that require many demonstrations or trials.