DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning

📄 arXiv: 2310.05333v2 📥 PDF

作者: Longxiang He, Li Shen, Linrui Zhang, Junbo Tan, Xueqian Wang

分类: cs.LG

发布日期: 2023-10-09 (更新: 2024-02-28)

备注: 22 pages, 9 figures, 6 tables. Submitted to ICML 2024. arXiv admin note: text overlap with arXiv:1910.13393 by other authors

🔗 代码/项目: GITHUB


💡 一句话要点

提出DiffCPS以解决离线强化学习中的约束策略搜索问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离线强化学习 约束策略搜索 扩散模型 优势加权回归 原始对偶方法 策略优化 机器人控制 智能推荐系统

📋 核心要点

  1. 现有的优势加权回归(AWR)方法在处理约束策略搜索时,因高斯策略的表达能力有限,可能导致分布外动作的问题。
  2. 本文提出的DiffCPS方法通过原始对偶方法,解决了扩散模型在约束策略搜索中的应用难题,能够有效处理策略概率密度的要求。
  3. 实验结果显示,DiffCPS在D4RL基准上表现优异,性能至少与传统AWR基线持平,甚至更佳,验证了其有效性。

📝 摘要(中文)

约束策略搜索(CPS)是离线强化学习中的一个基本问题,通常通过优势加权回归(AWR)来解决。然而,现有方法由于高斯策略的表达能力有限,可能仍会遇到分布外的动作。本文提出了一种新方法DiffCPS,利用原始对偶方法解决基于扩散的约束策略搜索。理论分析表明,扩散基础的CPS问题具有强对偶性,并在引入参数近似后,可以在$ extmath{O}(1/ε)$次对偶迭代后获得近似解。基于D4RL基准的广泛实验结果表明,DiffCPS在性能上优于传统的AWR基线以及最近的基于扩散的离线强化学习方法。

🔬 方法详解

问题定义:本文旨在解决离线强化学习中的约束策略搜索(CPS)问题。现有的AWR方法由于高斯策略的表达能力有限,容易导致分布外动作的出现,影响学习效果。

核心思路:DiffCPS方法通过引入原始对偶方法,克服了扩散模型在AWR框架中无法直接应用的难题。该方法能够在保证策略概率密度要求的同时,利用扩散模型的强表达能力。

技术框架:DiffCPS的整体架构包括两个主要模块:首先是基于扩散模型的策略生成模块,其次是通过对偶优化进行约束处理的模块。整个流程通过迭代优化实现策略的更新与约束的满足。

关键创新:DiffCPS的核心创新在于结合了扩散模型与原始对偶方法,解决了传统AWR方法在处理复杂策略时的局限性。这种结合使得策略的表达能力显著增强,能够更好地适应复杂的环境。

关键设计:在设计上,DiffCPS引入了参数近似技术,使得在$ extmath{O}(1/ε)$次对偶迭代后能够获得近似解。此外,损失函数的设计也考虑了策略的约束条件,确保了优化过程的有效性。具体的网络结构与参数设置在实验中进行了详细验证。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在D4RL基准测试中,DiffCPS在多个任务上表现出色,性能超过了传统的AWR基线,并与最新的基于扩散的离线强化学习方法相比,展现出更优或至少持平的效果。这表明DiffCPS在处理复杂约束问题时的有效性和优势。

🎯 应用场景

DiffCPS方法具有广泛的应用潜力,尤其在需要处理复杂约束的离线强化学习任务中,如机器人控制、自动驾驶和智能推荐系统等领域。其强大的策略表达能力和优化效率将为这些领域的实际应用提供新的解决方案,推动智能系统的进一步发展。

📄 摘要(原文)

Constrained policy search (CPS) is a fundamental problem in offline reinforcement learning, which is generally solved by advantage weighted regression (AWR). However, previous methods may still encounter out-of-distribution actions due to the limited expressivity of Gaussian-based policies. On the other hand, directly applying the state-of-the-art models with distribution expression capabilities (i.e., diffusion models) in the AWR framework is intractable since AWR requires exact policy probability densities, which is intractable in diffusion models. In this paper, we propose a novel approach, $\textbf{Diffusion-based Constrained Policy Search}$ (dubbed DiffCPS), which tackles the diffusion-based constrained policy search with the primal-dual method. The theoretical analysis reveals that strong duality holds for diffusion-based CPS problems, and upon introducing parameter approximation, an approximated solution can be obtained after $\mathcal{O}(1/ε)$ number of dual iterations, where $ε$ denotes the representation ability of the parametrized policy. Extensive experimental results based on the D4RL benchmark demonstrate the efficacy of our approach. We empirically show that DiffCPS achieves better or at least competitive performance compared to traditional AWR-based baselines as well as recent diffusion-based offline RL methods. The code is now available at https://github.com/felix-thu/DiffCPS.