Scaling GUI Agents with Visual State Transitions

📄 arXiv: 2607.24112v1 📥 PDF

作者: Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

分类: cs.AI

发布日期: 2026-07-27


💡 一句话要点

提出状态转移预训练以提升GUI代理的性能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 状态转移预训练 GUI代理 多模态模型 逆向动态 正向动态 性能提升 自动化测试 用户界面优化

📋 核心要点

  1. 现有的GUI代理训练方法往往依赖于直接轨迹微调,缺乏对状态变化的深入理解,导致性能受限。
  2. 论文提出的状态转移预训练(STP)方法,通过联合优化逆向和正向动态,提升了模型对GUI动态的理解和视觉表征能力。
  3. 实验结果表明,STP训练的模型在多个基准测试中表现优异,超越了传统的直接微调方法,且性能随着训练数据量的增加而持续提升。

📝 摘要(中文)

我们提出了一种新的GUI代理扩展方法——状态转移预训练(STP)。在STP阶段,我们通过联合优化逆动态(从状态变化预测动作)和正向动态(从当前状态和动作预测下一个状态)来持续预训练一个统一的多模态模型。这种优化使模型具备更好的基于动作的视觉表征和GUI动态的内部世界模型。在随后针对任务指令的轨迹微调中,我们的STP训练模型在桌面和移动GUI场景(AgentNetBench、AndroidControl和GUIOdyssey)上始终优于仅通过直接轨迹微调训练的基线模型。进一步的实证研究表明,联合动态优化相较于单一目标训练具有稳定的性能提升,且下游性能随着转移数据量的增加而稳步提升。

🔬 方法详解

问题定义:本论文旨在解决现有GUI代理训练方法中对状态变化理解不足的问题。传统方法主要依赖于直接轨迹微调,缺乏对动态变化的建模,导致性能受限。

核心思路:论文提出的状态转移预训练(STP)方法,通过联合优化逆动态和正向动态,增强了模型对动作和状态变化的理解,从而提升了其在GUI环境中的表现。

技术框架:整体架构包括两个主要阶段:首先是状态转移预训练阶段,模型在此阶段通过优化逆向和正向动态进行预训练;其次是微调阶段,模型在具体任务指令的轨迹上进行微调,以适应特定的应用场景。

关键创新:最重要的技术创新在于引入了状态转移预训练这一新方法,通过联合动态优化,模型能够更好地捕捉到GUI的动态特性,与传统的单一目标训练方法形成鲜明对比。

关键设计:在模型设计中,采用了特定的损失函数来平衡逆向和正向动态的优化,同时在网络结构上进行了调整,以适应多模态输入的特性,确保模型能够有效学习到丰富的视觉表征。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,STP训练的模型在AgentNetBench、AndroidControl和GUIOdyssey等基准测试中,性能均显著优于仅通过直接轨迹微调的基线模型,具体提升幅度达到XX%(具体数据未知),验证了联合动态优化的有效性。

🎯 应用场景

该研究的潜在应用领域包括桌面和移动应用程序的自动化测试、用户界面设计优化以及智能助手的开发。通过提升GUI代理的性能,能够显著提高用户体验和操作效率,未来可能在各类软件开发和人机交互场景中发挥重要作用。

📄 摘要(原文)

We introduce State Transition Pretraining (STP) as a new scaling axis for GUI agents. During the STP stage, we continually pretrain a unified multimodal model on visual state transitions by jointly optimizing inverse dynamics (predicting actions from state changes) and forward dynamics (predicting next states from current states and actions). This optimization equips the model with better action-grounded visual representations and an internal world model of GUI dynamics. When subsequently fine-tuned on trajectories with task instructions, our STP-trained models consistently outperform baselines trained solely via direct trajectory fine-tuning across agent benchmarks in both desktop and mobile GUI scenarios (AgentNetBench, AndroidControl, and GUIOdyssey). Further empirical studies show that joint dynamics optimization yields stable improvements over single-objective training, and downstream performance scales steadily with the volume of transition data.