SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

📄 arXiv: 2607.15550 📥 PDF

作者: Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng

分类: cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出SeerGuard框架以解决移动GUI代理的安全风险问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 移动GUI代理 安全框架 风险评估 多任务学习 世界模型 自动化技术 人机交互

📋 核心要点

  1. 现有的安全机制主要是反应式的,无法在执行前有效评估移动GUI代理的风险。
  2. 提出SeerGuard框架,通过指令级筛选和动作级风险评估,提前识别潜在风险。
  3. 在Qwen3-VL-8B-Instruct上,SeerGuard将安全效用评分从0.191提升至0.596,风险成本评分从0.347降低至0.130。

📝 摘要(中文)

移动图形用户界面(GUI)代理在自动化复杂任务方面展现了显著能力,但也引入了关键的安全风险,单一错误操作可能导致不可逆后果。现有的安全机制主要是反应式的,缺乏在执行前评估风险的能力。本文提出了SeerGuard,一个基于后果意识的安全框架,通过执行前的指令级筛选和动作级风险评估来减轻这些风险。具体而言,动作级评估分析代理在当前GUI状态下提出的动作,预测可能的结果以识别执行前的风险。我们通过多任务学习构建了统一的安全增强世界模型(SAWM),将语义下一个状态预测与安全风险评估相结合。大量实验表明,SeerGuard在多种移动GUI代理中有效泛化。

🔬 方法详解

问题定义:本文旨在解决移动GUI代理在执行任务时的安全风险问题。现有方法缺乏在执行前对潜在风险的评估,导致错误操作可能造成严重后果。

核心思路:SeerGuard框架通过在执行前进行指令级筛选和动作级风险评估,提前识别和减轻风险。此设计使得代理在执行动作前能够预测可能的后果,从而避免潜在的错误。

技术框架:整体架构包括两个主要模块:安全增强世界模型(SAWM)和风险评估模块。SAWM通过多任务学习整合语义下一个状态预测与安全风险评估,形成一个统一的模型。

关键创新:最重要的技术创新在于将安全风险评估与状态预测结合,形成了一个前所未有的后果意识框架。这与现有的反应式安全机制形成了本质区别,能够在执行前主动识别风险。

关键设计:在模型设计中,采用了多任务学习的方法,结合了不同的损失函数以优化安全性和效用性。同时,关键参数如风险评估阈值和状态预测精度也经过精心调节,以确保模型的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SeerGuard在Qwen3-VL-8B-Instruct上的安全效用评分从0.191提升至0.596,风险成本评分从0.347降低至0.130,表明该框架在提升安全性和效用性方面具有显著效果,验证了其在多种移动GUI代理中的有效性。

🎯 应用场景

SeerGuard框架具有广泛的应用潜力,尤其在自动化操作、智能助手和人机交互等领域。通过提升移动GUI代理的安全性,该框架能够有效减少因错误操作导致的损失,增强用户信任,推动智能技术的普及与应用。未来,该技术还可能扩展到更复杂的自动化系统中,进一步提升安全性和可靠性。

📄 摘要(原文)

Mobile graphical user interface (GUI) agents have demonstrated remarkable capabilities in automating complex tasks, yet they introduce critical safety risks where a single erroneous action can lead to irreversible consequences. Existing safety mechanisms are primarily reactive, lacking the ability to assess risks before execution. In this paper, we introduce SeerGuard, a consequence-aware safety framework designed to mitigate these risks through pre-execution instruction-level screening and action-level risk assessment. Specifically, the action-level assessment analyzes agent-proposed actions within current GUI states, anticipating likely outcomes to identify risks before they are executed. To enable these capabilities, we construct a unified safety-augmented world model (SAWM) via multi-task learning, integrating semantic next-state prediction with safety risk assessment. Extensive experiments demonstrate that SeerGuard generalizes effectively across diverse mobile GUI agents. On Qwen3-VL-8B-Instruct, it increases the safety-utility score from $0.191$ to $0.596$ at $\omega=0.8$ and reduces the risk-cost score from $0.347$ to $0.130$ at $\alpha=0.8$. Further analyses on our SAWM validate the effectiveness of the instruction-level screening, alongside the capability of action risk assessment and next-state prediction.