ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

📄 arXiv: 2607.10350 📥 PDF

作者: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

分类: cs.AI, cs.RO

发布日期: 2026-07-20


💡 一句话要点

提出ABot-AgentOS以解决长时间嵌入式智能体的推理与记忆问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操作系统 多模态记忆 自我进化 智能体推理 任务执行 动态环境 基准评估

📋 核心要点

  1. 现有的VLM和VLA系统在机器人感知和动作预测方面取得了进展,但在长时间执行中缺乏有效的推理和记忆机制。
  2. ABot-AgentOS通过提供一个通用的智能体操作系统,整合多模态记忆和自我进化机制,提升了智能体的推理和执行能力。
  3. 在初步的EmbodiedWorldBench子集上,ABot-AgentOS在任务成功率和目标完成度上均优于单控制器基线,显示出显著的性能提升。

📝 摘要(中文)

近年来,视觉语言模型(VLM)和视觉语言代理(VLA)系统提升了机器人感知和动作预测能力,但长时间嵌入式智能体仍需一个通用的运行时层来进行推理、记忆、工具使用、验证和跨实体执行。本文提出了ABot-AgentOS,一个通用的机器人操作系统,位于低级控制器之上,为场景条件规划、上下文隔离的技能执行、多阶段验证、多模态记忆和边缘-云协作提供了深思熟虑的智能体层。为评估这些系统,本文引入了EmbodiedWorldBench,一个可执行的基准,涵盖16个室内、室外和混合场景,四个难度级别,以及超过200个任务,涉及导航、物体搜索、NPC对话、动态事件和基于轨迹的评分。

🔬 方法详解

问题定义:本文旨在解决长时间嵌入式智能体在推理、记忆和工具使用等方面的不足,现有方法在这些领域的表现不尽如人意,缺乏有效的通用运行时层。

核心思路:ABot-AgentOS的核心思想是构建一个通用的智能体操作系统,提供一个深思熟虑的智能体层,支持场景条件下的规划和多模态记忆的整合,以提升智能体的长期执行能力。

技术框架:ABot-AgentOS的整体架构包括多个模块:场景条件规划模块、上下文隔离技能执行模块、多阶段验证模块、通用多模态图记忆模块以及边缘-云协作模块。这些模块协同工作,支持智能体在复杂环境中的决策和执行。

关键创新:最重要的技术创新在于引入了通用多模态图记忆,它将对话、视觉观察、空间上下文、时间关系和任务轨迹转化为类型节点和边,形成持久的记忆结构。此外,自我进化机制将内存故障转化为有针对性的运行时进化资产,促进持续改进。

关键设计:在设计中,ABot-AgentOS采用了多模态图结构,节点和边的类型化设计使得信息的存储和检索更加高效。同时,设置了特定的损失函数以优化记忆的准确性和可靠性,确保智能体在执行任务时能够有效利用历史信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在初步的EmbodiedWorldBench子集上,ABot-AgentOS在任务成功率上达到了87.5,目标完成度上也有显著提升。通过自我进化机制,LoCoMo的得分从87.5提升至88.7,OpenEQA从59.9提升至60.4,Mem-Gallery从88.6提升至89.0,显示出该系统在长期执行中的优势。

🎯 应用场景

ABot-AgentOS具有广泛的应用潜力,适用于智能机器人、自动驾驶、虚拟助手等领域。通过提供持久的多模态记忆和高效的推理能力,该系统能够在复杂的动态环境中实现更高效的任务执行和人机交互,推动智能体技术的进一步发展。

📄 摘要(原文)

Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.