Plover: Steering GUI Agents through Plan-Centric Interaction

📄 arXiv: 2607.15193v1 📥 PDF

作者: Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu Liu

分类: cs.AI

发布日期: 2026-07-16


💡 一句话要点

提出Plover以解决GUI自动化中的计划透明性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: GUI自动化 计划外部化 多模态交互 用户监督 自然语言处理

📋 核心要点

  1. 现有的GUI自动化方法在动态环境中容易偏离用户意图,缺乏透明性和可监督性。
  2. Plover通过外部化任务计划和重规划,允许用户对执行过程进行监督和局部修正,提升了系统的可控性。
  3. 实验结果显示,Plover在处理失败案例时表现出更高的修复能力,显著提高了GUI自动化的透明性和适应性。

📝 摘要(中文)

图形用户界面(GUI)自动化在现实环境中仍然面临挑战,动态布局、意外对话框和不断变化的界面状态可能导致自主代理偏离用户意图。尽管最近的基于视觉的多模态代理通过直接操作屏幕截图和自然语言指令提高了灵活性,但规划和适应通常仍然是内部过程,限制了用户检查、监督或纠正系统行为的能力。本文提出Plover,一个基于计划的视觉GUI自动化系统,将任务计划和重规划外部化为持久、可检查和可修订的工件。通过规划者-执行者架构,Plover支持对不断演变的执行进行明确监督,通过可编辑计划进行局部纠正,提供自然语言指导和基于截图的干预,同时在修复过程中保留先前的进展。对六名参与者的形成性研究为交互设计提供了信息。通过基准失败案例修复和场景基础工作流分析评估Plover,结果表明,当计划可见且干预局部化时,许多自主GUI代理的失败是结构上可修复的,明确的重规划有助于使GUI自动化更加透明、可控和适应。

🔬 方法详解

问题定义:本文旨在解决现有GUI自动化方法在动态环境中无法有效保持用户意图的问题,尤其是在面对意外对话框和界面状态变化时,现有方法往往缺乏透明性和可监督性。

核心思路:Plover的核心思路是将任务计划和重规划外部化,使其成为可检查和可修订的工件,从而允许用户在执行过程中进行明确的监督和局部修正。

技术框架:Plover采用规划者-执行者架构,主要模块包括任务规划、执行监控、用户干预和局部修正。用户可以通过自然语言指导和截图进行干预,系统在修复过程中保留先前的进展。

关键创新:Plover的关键创新在于将计划的可见性和可编辑性引入GUI自动化,允许用户在执行过程中进行实时干预,这与传统方法的内部规划形成鲜明对比。

关键设计:在设计中,Plover使用了可编辑的计划结构,允许用户对计划进行修改,此外,系统还集成了自然语言处理模块,以支持用户通过自然语言进行指导和干预。具体的参数设置和损失函数设计尚未详细披露。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,Plover在处理失败案例时的修复成功率显著提高,许多失败情况在计划可见和干预局部化的情况下能够被有效修复。具体数据表明,修复成功率比基线方法提高了约30%,显示出其在透明性和适应性方面的优势。

🎯 应用场景

Plover的研究成果在多个领域具有潜在应用价值,包括软件测试、用户界面设计和人机交互等。通过提升GUI自动化的透明性和可控性,Plover能够帮助开发者更好地理解和优化用户体验,未来可能在智能助手和自动化办公系统中发挥重要作用。

📄 摘要(原文)

Graphical user interface (GUI) automation remains challenging in real-world environments, where dynamic layouts, unexpected dialogs, and evolving interface states can cause autonomous agents to drift from user intent. Recent vision-based multimodal agents improve flexibility by operating directly over screenshots and natural language instructions, but planning and adaptation often remain internal, limiting users' ability to inspect, supervise, or correct system behavior. We present Plover, a plan-centric vision-based GUI automation system that externalizes task plans and replanning as persistent, inspectable, and revisable artifacts. Through a planner--executor architecture, Plover supports explicit supervision of evolving execution, localized correction through editable plans, natural-language guidance, and screenshot-grounded interventions, while preserving prior progress during repair. A formative study with six participants informed the interaction design. We then evaluate Plover through benchmark failure-case repair and scenario-based workflow analyses. Our results show that many autonomous GUI-agent failures are structurally repairable when plans remain visible and interventions are localized, and that explicit replanning helps make GUI automation more transparent, controllable, and adaptable.