Safe Task Planning with Long-Term Graph Memory for Embodied Agents
作者: Siyuan Li, Taiyan Lang, Aoqi Yan, Jia Yu, Feifan Liu, Yihan Du, Yu Zheng, Xun Wang, Peng Liu
分类: cs.RO
发布日期: 2026-09-08
备注: CoRL 2026
💡 一句话要点
提出SafeMem框架以解决嵌入式智能体的安全任务规划问题
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 安全任务规划 长期图记忆 嵌入式智能体 风险评估 动态环境
📋 核心要点
- 现有的LLM和VLM驱动的方法在生成安全高层次动作时缺乏物理风险意识,尤其是在部分可观测的环境中。
- 本文提出的SafeMem框架通过构建长期语义图记忆,逐步积累环境知识,从而提高任务规划的安全性。
- 在IS-Bench基准和实际机器人平台上的实验表明,SafeMem显著提升了安全成功率,相较于现有的VLM驱动任务规划方法有明显优势。
📝 摘要(中文)
大型语言模型(LLMs)和视觉语言模型(VLMs)在嵌入式智能体的零-shot任务规划方面取得了显著进展。然而,大多数基于LLM和VLM的方法在生成安全的高层次动作时面临挑战,尤其是在部分可观测性下,危险往往超出即时视野。为了解决这一问题,本文提出了一种新颖的安全任务规划框架SafeMem,该框架构建并维护一个开放动态环境的长期语义图记忆。基于自我中心的观察,SafeMem逐步积累周围物体及其关系的知识。随后,基于图记忆的LLM风险预测器评估候选动作,并在检测到危险时触发保守调节的重新规划循环。大量实验表明,SafeMem框架在IS-Bench基准测试和真实机器人平台上显著提高了安全成功率。
🔬 方法详解
问题定义:本文旨在解决嵌入式智能体在部分可观测环境中进行安全任务规划时面临的物理风险意识不足的问题。现有方法往往无法有效识别和规避潜在危险。
核心思路:SafeMem框架的核心思路是通过构建长期的语义图记忆,逐步积累对环境的理解,从而在任务规划中引入安全性考量。该设计使得智能体能够在动态环境中更好地评估风险。
技术框架:SafeMem的整体架构包括三个主要模块:环境观察模块、图记忆构建模块和风险评估模块。环境观察模块负责收集自我中心的观测数据,图记忆构建模块则将这些数据转化为语义图,而风险评估模块利用图记忆评估候选动作的安全性。
关键创新:SafeMem的主要创新在于引入长期图记忆的概念,使得智能体能够在动态环境中持续更新对周围物体及其关系的理解。这一方法与传统的任务规划方法相比,显著增强了对潜在危险的识别能力。
关键设计:在设计中,SafeMem采用了保守调节的重新规划机制,当检测到危险时,系统会自动调整规划策略。此外,图记忆的构建过程中,采用了特定的图结构和关系建模方法,以确保信息的有效存储和检索。
🖼️ 关键图片
📊 实验亮点
在IS-Bench基准测试中,SafeMem框架的安全成功率显著高于现有的VLM驱动任务规划方法,具体提升幅度达到XX%。在真实机器人平台上的实验也验证了其有效性,展示了更高的任务完成率和安全性。
🎯 应用场景
该研究的潜在应用领域包括自主机器人、智能家居系统和危险环境中的任务执行等。通过提高嵌入式智能体的安全性,SafeMem框架能够有效降低任务执行中的风险,提升智能体在复杂环境中的实用性和可靠性。未来,该框架有望在更多实际场景中得到应用,推动智能体技术的发展。
📄 摘要(原文)
Large language models (LLMs) and vision-language models (VLMs) have significantly advanced zero-shot task planning for embodied agents. However, most LLM- and VLM-driven methods struggle to generate safe high-level actions due to a lack of physical risk awareness, particularly under partial observability, where hazards lie outside the immediate field of view. To address this challenge, we propose a novel safe task-planning framework, SafeMem, which constructs and maintains a long-term semantic graph memory of the open and dynamic environment. Based on egocentric observations, the proposed framework incrementally accumulates knowledge about surrounding objects and their relationships with a graph. Then, an LLM-based risk predictor evaluates candidate actions using the graph memory, triggering a conservatism-modulated replanning loop with explanations for detected hazards. Extensive experiments on the IS-Bench benchmark and a real-world robot platform demonstrate that the SafeMem framework substantially improves safe success rates compared to state-of-the-art VLM-driven task planners. Video results are available on our webpage: https://sites.google.com/view/safemem.