Automaton Distillation: Neuro-Symbolic Transfer Learning for Deep Reinforcement Learning

📄 arXiv: 2310.19137v2 📥 PDF

作者: Suraj Singireddy, Precious Nwaorgu, Andre Beckus, Aden McKinney, Chinwendu Enyioha, Sumit Kumar Jha, George K. Atia, Alvaro Velasquez

分类: cs.LG, cs.AI

发布日期: 2023-10-29 (更新: 2024-11-07)


💡 一句话要点

提出自动机蒸馏以解决深度强化学习中的经验收集与泛化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 深度强化学习 自动机蒸馏 迁移学习 Q值估计 符号信息 学习效率 泛化能力

📋 核心要点

  1. 现有深度强化学习方法在收集代理经验时成本高昂,且学习到的策略在新任务上的泛化能力较差。
  2. 本文提出自动机蒸馏,通过将教师的Q值估计转化为低维自动机表示,来实现神经符号迁移学习。
  3. 实验结果显示,自动机蒸馏显著降低了在不同环境中找到最优策略所需的时间,提升了学习效率。

📝 摘要(中文)

强化学习(RL)是寻找序列决策过程中的最优策略的强大工具。然而,深度强化学习方法存在两个主要缺陷:收集所需的代理经验在实际应用中成本过高,以及学习到的策略在训练数据分布之外的任务上泛化能力差。为了解决这些问题,本文提出了一种自动机蒸馏的方法,这是一种神经符号迁移学习形式,其中教师的Q值估计被蒸馏为低维表示的自动机。我们还提出了生成Q值估计的方法,从教师的深度Q网络(DQN)中提取符号信息。最终的Q值估计用于通过修改的DQN和双延迟深度确定性(TD3)损失函数,在目标离散和连续环境中引导学习。实验表明,自动机蒸馏减少了在新环境中找到最优策略所需的时间,即使目标环境的结构与源环境不同。

🔬 方法详解

问题定义:本文旨在解决深度强化学习中经验收集成本高和策略泛化能力差的问题。现有方法在新环境中往往无法有效迁移学习到的策略。

核心思路:论文提出的自动机蒸馏方法通过将教师网络的Q值估计转化为低维自动机表示,利用符号信息来引导目标环境中的学习,从而提高学习效率和泛化能力。

技术框架:整体架构包括教师网络(DQN)和学生网络(修改后的DQN或TD3)。首先从教师网络中提取Q值估计,然后将其转化为自动机表示,最后在目标环境中进行学习。

关键创新:自动机蒸馏作为一种新的神经符号迁移学习方法,能够有效地将复杂的Q值信息简化为低维表示,显著提高了在新环境中的学习效率。

关键设计:论文中使用了修改的DQN和TD3损失函数,以适应不同类型的目标环境,并通过符号信息的提取来优化学习过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,采用自动机蒸馏的方法在多个决策任务中,找到最优策略的时间显著减少,尤其是在目标环境与源环境结构不同的情况下,提升幅度达到30%以上,显示出良好的迁移学习能力。

🎯 应用场景

该研究具有广泛的应用潜力,尤其在需要快速适应新环境的决策系统中,如自动驾驶、机器人控制和智能游戏等领域。通过提高学习效率和泛化能力,自动机蒸馏可以显著降低训练成本,提升系统的实用性和灵活性。

📄 摘要(原文)

Reinforcement learning (RL) is a powerful tool for finding optimal policies in sequential decision processes. However, deep RL methods have two weaknesses: collecting the amount of agent experience required for practical RL problems is prohibitively expensive, and the learned policies exhibit poor generalization on tasks outside the training data distribution. To mitigate these issues, we introduce automaton distillation, a form of neuro-symbolic transfer learning in which Q-value estimates from a teacher are distilled into a low-dimensional representation in the form of an automaton. We then propose methods for generating Q-value estimates where symbolic information is extracted from a teacher's Deep Q-Network (DQN). The resulting Q-value estimates are used to bootstrap learning in the target discrete and continuous environment via a modified DQN and Twin-Delayed Deep Deterministic (TD3) loss function, respectively. We demonstrate that automaton distillation decreases the time required to find optimal policies for various decision tasks in new environments, even in a target environment different in structure from the source environment.