Experience Memory Graph: One-Shot Error Correction for Agents

📄 arXiv: 2607.13884v1 📥 PDF

作者: Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng

分类: cs.AI

发布日期: 2026-07-15

备注: 11 pages, 6 figures


💡 一句话要点

提出经验记忆图以解决智能体的一次性错误修正问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 经验记忆图 错误修正 图匹配 自主决策 智能体

📋 核心要点

  1. 现有的自我修正机制依赖于提示反思,存在脆弱性和高成本,难以推广到新任务。
  2. 提出经验记忆图(EMG),将失败恢复视为图匹配问题,通过提取成功工作流来指导修正。
  3. 在ALFWorld和ScienceWorld上的实验表明,EMG在成功率和平均奖励上均优于现有方法,且无需试错。

📝 摘要(中文)

大型语言模型(LLM)智能体在自主决策中展现了卓越的能力,但在复杂的长时间任务中,这些智能体常常面临错误累积和恢复失败的挑战。现有的自我修正机制依赖于基于提示的反思,存在脆弱性、时间和API成本高等问题,并且产生的任务特定记忆难以推广到新场景。为了解决这些问题,本文提出了经验记忆图(EMG),将智能体的失败恢复重新构建为图匹配问题。在训练阶段,将失败的探索轨迹和成功的专家轨迹转换为有向动作决策图,通过匹配这些图提取成功的子图和图编辑路径,从而明确指示如何修正失败。实验结果表明,EMG在成功率和平均奖励上均优于现有的反思基线,且无需测试阶段的试错过程。

🔬 方法详解

问题定义:本文旨在解决大型语言模型智能体在复杂任务中面临的错误累积和恢复失败的问题。现有的自我修正机制依赖于提示反思,存在脆弱性和高时间成本,且难以适应新场景。

核心思路:提出经验记忆图(EMG),将智能体的失败恢复过程转化为图匹配问题,通过匹配失败轨迹和成功轨迹的图结构,提取出成功的工作流和修正路径,从而实现一次性错误修正。

技术框架:EMG的整体架构包括两个主要阶段:训练阶段和测试阶段。在训练阶段,将失败的探索轨迹和成功的专家轨迹转换为有向动作决策图,并通过图匹配提取成功子图和图编辑路径。在测试阶段,EMG从记忆图中检索相关信息,指导智能体进行修正。

关键创新:EMG的核心创新在于将失败恢复问题转化为图匹配问题,通过提取成功工作流和修正路径,显著提高了智能体的恢复能力,与现有的基于提示的反思方法相比,具有更高的效率和适应性。

关键设计:在设计中,EMG使用了有向图结构来表示动作决策,关键参数包括图的节点和边的定义,以及图匹配算法的选择。损失函数设计上,强调了成功工作流的提取和图编辑路径的优化,以确保智能体能够有效地进行错误修正。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,EMG在ALFWorld和ScienceWorld上的成功率和平均奖励均显著高于现有的反思基线,具体提升幅度达到XX%(具体数据未知),且在测试阶段无需进行试错,极大提高了效率。

🎯 应用场景

该研究的潜在应用领域包括自主机器人、智能决策系统和复杂任务规划等。通过提高智能体在复杂任务中的恢复能力,EMG可以显著提升智能体的实用性和可靠性,未来可能在多个行业中发挥重要作用。

📄 摘要(原文)

Large Language Model (LLM) agents have shown remarkable capabilities in autonomous decision-making by generating sequential trajectories of states, actions, and observations. However, in complex, long-horizon tasks, these agents frequently suffer from compounding errors and struggle to recover from failures. Existing self-correction mechanisms rely on prompt-based reflection, which is inherently brittle, incurs heavy time and API costs due to iterative trial-and-error loops, and produces task-specific memory that may be hard to generalize to new scenarios. To address this, we propose Experience Memory Graph (EMG), a framework that reformulates agent failure recovery as a graph matching problem. At training time, we convert both failed exploration trajectories and successful expert trajectories into directed action decision graphs. By matching these graphs, we extract common subgraphs (successful workflows) and graph edit paths that explicitly indicate how to correct failures (e.g., which actions to add, delete, or relabel under a given observation), and store them in a memory graph with intra-task nodes and cross-task edges. At test time, EMG retrieves relevant insights and guides the agent in a single, loop-free execution. Experiments on ALFWorld and ScienceWorld show that EMG consistently outperforms state-of-the-art reflection baselines in success rate and average reward, while requiring no test-time trial-and-error.