Score Regularized Policy Optimization through Diffusion Behavior

📄 arXiv: 2310.07297v3 📥 PDF

作者: Huayu Chen, Cheng Lu, Zhengyi Wang, Hang Su, Jun Zhu

分类: cs.LG

发布日期: 2023-10-11 (更新: 2024-03-15)

备注: ICLR 2024


💡 一句话要点

提出高效的确定性推理策略以解决扩散模型采样慢的问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离线强化学习 扩散模型 策略优化 生成模型 动作采样 深度学习 机器人控制

📋 核心要点

  1. 现有的扩散模型在离线强化学习中表现出色,但其采样速度极慢,限制了实际应用。
  2. 本文提出了一种从评论模型和预训练的扩散行为模型中提取高效确定性推理策略的方法,优化了策略梯度。
  3. 实验结果显示,该方法在运动任务中将动作采样速度提升超过25倍,同时保持了最先进的性能水平。

📝 摘要(中文)

近年来,离线强化学习的发展揭示了扩散建模在表示异构行为策略方面的巨大潜力。然而,从扩散策略中采样的速度相当缓慢,因为每个动作需要数十到数百次迭代推理步骤。为了解决这个问题,本文提出从评论模型和预训练的扩散行为模型中提取高效的确定性推理策略,利用后者在优化过程中通过行为分布的评分函数直接对策略梯度进行正则化。我们的方法在训练和评估过程中享有扩散建模的强大生成能力,同时完全避免了计算密集和耗时的扩散采样方案。在D4RL任务上的广泛结果表明,我们的方法在运动任务中将动作采样速度提升了超过25倍,同时仍保持了最先进的性能。

🔬 方法详解

问题定义:本文旨在解决扩散模型在离线强化学习中采样速度慢的问题。现有方法需要大量迭代推理步骤,导致计算效率低下。

核心思路:我们提出从评论模型和预训练的扩散行为模型中提取高效的确定性推理策略,通过行为分布的评分函数直接正则化策略梯度,从而加速优化过程。

技术框架:整体架构包括两个主要模块:评论模型用于评估策略的价值,扩散行为模型用于生成行为分布。优化过程通过结合这两个模块的输出,提升策略的生成效率。

关键创新:本文的主要创新在于通过直接正则化策略梯度,避免了传统扩散模型的高计算成本,从而实现了高效的策略优化。

关键设计:在参数设置上,我们采用了适应性学习率和特定的损失函数,以确保模型在训练过程中能够快速收敛,同时保持生成的多样性和质量。网络结构上,结合了深度神经网络和扩散模型的特点,提升了生成能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,本文方法在D4RL运动任务中,动作采样速度提升超过25倍,相较于多种领先的基于扩散的方法,仍然保持了最先进的性能,展示了其在实际应用中的巨大潜力。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、游戏AI等,能够显著提升这些领域中策略生成的效率和性能。通过加速采样过程,该方法有望在实际应用中实现更快的决策和响应,推动智能系统的发展。

📄 摘要(原文)

Recent developments in offline reinforcement learning have uncovered the immense potential of diffusion modeling, which excels at representing heterogeneous behavior policies. However, sampling from diffusion policies is considerably slow because it necessitates tens to hundreds of iterative inference steps for one action. To address this issue, we propose to extract an efficient deterministic inference policy from critic models and pretrained diffusion behavior models, leveraging the latter to directly regularize the policy gradient with the behavior distribution's score function during optimization. Our method enjoys powerful generative capabilities of diffusion modeling while completely circumventing the computationally intensive and time-consuming diffusion sampling scheme, both during training and evaluation. Extensive results on D4RL tasks show that our method boosts action sampling speed by more than 25 times compared with various leading diffusion-based methods in locomotion tasks, while still maintaining state-of-the-art performance.