Reinforcement Learning with Fast and Forgetful Memory

📄 arXiv: 2310.04128v1 📥 PDF

作者: Steven Morad, Ryan Kortvelesy, Stephan Liwicki, Amanda Prorok

分类: cs.LG, cs.AI

发布日期: 2023-10-06

🔗 代码/项目: GITHUB


💡 一句话要点

提出快速遗忘记忆以解决强化学习中的记忆问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 记忆模型 递归神经网络 算法优化 部分可观测任务

📋 核心要点

  1. 现有的无模型强化学习方法在处理部分可观测任务时,往往依赖于监督学习中的记忆模型,导致效率低下。
  2. 本文提出的快速遗忘记忆模型,专为强化学习设计,通过强结构先验来优化记忆使用,提升学习效率。
  3. 实验结果表明,快速遗忘记忆在多个基准测试中超越了传统RNN,且训练速度显著提高,表现出更好的奖励效果。

📝 摘要(中文)

几乎所有现实世界任务都是部分可观测的,因此在强化学习(RL)中需要使用记忆。大多数无模型方法通过借用监督学习(SL)中的记忆模型,将轨迹总结为潜在的马尔可夫状态,尽管RL在训练和效率特性上表现出不同的特点。为了解决这一差异,本文提出了一种专为RL设计的算法无关的记忆模型——快速遗忘记忆。该方法通过受计算心理学启发的强结构先验来限制模型搜索空间。作为递归RL算法中递归神经网络(RNN)的替代方案,快速遗忘记忆在各种递归基准和算法中实现了比RNN更高的奖励,且未改变任何超参数。此外,快速遗忘记忆的训练速度比RNN快两个数量级,归因于其对数时间和线性空间复杂度。我们的实现可在https://github.com/proroklab/ffm获取。

🔬 方法详解

问题定义:本文旨在解决现有强化学习方法在处理部分可观测任务时的记忆效率低下问题。传统的RNN在此类任务中表现不佳,导致学习过程缓慢且效果不理想。

核心思路:快速遗忘记忆模型通过引入强结构先验,优化了记忆的使用方式,使其更适合强化学习的特性,从而提高了学习效率和效果。

技术框架:该模型可以作为递归神经网络的替代品,集成到现有的递归强化学习算法中。整体架构包括记忆模块和决策模块,前者负责信息的存储与遗忘,后者则进行策略更新。

关键创新:快速遗忘记忆的最大创新在于其算法无关性和高效的记忆管理机制,与传统RNN相比,显著提高了训练速度和学习效果。

关键设计:该模型的设计包括对数时间复杂度和线性空间复杂度的实现,确保在处理大规模数据时仍能保持高效。此外,模型的超参数设置与传统RNN保持一致,便于直接替换。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,快速遗忘记忆在多个递归基准测试中实现了比传统RNN更高的奖励,且训练速度提高了两个数量级,展现出显著的性能优势。

🎯 应用场景

快速遗忘记忆模型在机器人控制、游戏智能体和自动驾驶等领域具有广泛的应用潜力。其高效的记忆管理能力能够提升智能体在复杂环境中的决策能力,推动智能系统的进一步发展。

📄 摘要(原文)

Nearly all real world tasks are inherently partially observable, necessitating the use of memory in Reinforcement Learning (RL). Most model-free approaches summarize the trajectory into a latent Markov state using memory models borrowed from Supervised Learning (SL), even though RL tends to exhibit different training and efficiency characteristics. Addressing this discrepancy, we introduce Fast and Forgetful Memory, an algorithm-agnostic memory model designed specifically for RL. Our approach constrains the model search space via strong structural priors inspired by computational psychology. It is a drop-in replacement for recurrent neural networks (RNNs) in recurrent RL algorithms, achieving greater reward than RNNs across various recurrent benchmarks and algorithms without changing any hyperparameters. Moreover, Fast and Forgetful Memory exhibits training speeds two orders of magnitude faster than RNNs, attributed to its logarithmic time and linear space complexity. Our implementation is available at https://github.com/proroklab/ffm.