Safe Reinforcement Learning using Ideas from Model Predictive Control

📄 arXiv: 2607.07252v1 📥 PDF

作者: Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

分类: cs.LG, cs.RO

发布日期: 2026-07-08

备注: Accepted at Eurocast 2026


💡 一句话要点

提出一种结合深度强化学习与模型预测控制的安全强化学习框架

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 安全强化学习 深度强化学习 模型预测控制 网络物理系统 机器人控制 自动驾驶 实验验证

📋 核心要点

  1. 现有的强化学习方法在实际应用中难以保证严格的安全约束,可能导致物理系统的不可逆损害。
  2. 本文提出了一种将深度强化学习与模型预测控制相结合的框架,通过安全过滤器确保探索过程中的安全性。
  3. 在实验中,该方法在非线性1自由度实验台上实现了成功的探索和稳定的策略收敛,验证了其有效性。

📝 摘要(中文)

强化学习(RL)能够直接从数据中合成控制策略,适用于复杂的网络物理系统(CPS)和机器人。然而,在主动学习阶段确保严格的安全约束仍然是一个挑战。本文提出了一种通用框架,将深度强化学习(DRL)的自适应高性能特性与模型预测控制(MPC)的形式安全保证相结合。通过系统动力学的数学模型,离线MPC计算定义了可行的状态-动作空间,确保约束满足。在训练和部署过程中,RL代理的瞬时动作通过安全过滤器投影到这一全球验证的可行集上。我们在非线性1自由度实验台上系统评估了该通用方法,展示了成功的探索和稳定的策略收敛。

🔬 方法详解

问题定义:本文旨在解决在强化学习过程中如何确保严格的安全约束的问题。现有方法在探索阶段可能违反物理系统的机械限制,导致不可逆损害。

核心思路:论文提出的核心思路是结合深度强化学习的自适应能力与模型预测控制的安全性,通过定义可行的状态-动作空间来保证安全性。

技术框架:整体架构包括离线MPC计算模块和RL训练模块。离线MPC计算定义了可行的状态-动作空间,而RL代理的动作则通过安全过滤器投影到这一空间中。

关键创新:最重要的技术创新在于将深度强化学习与模型预测控制相结合,形成了一种新的安全强化学习框架,确保了在探索过程中的安全性。与现有方法相比,该框架提供了形式化的安全保证。

关键设计:在设计中,采用了系统动力学的数学模型进行离线MPC计算,定义了可行的状态-动作空间。安全过滤器的设计确保了RL代理的动作始终在安全范围内。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,所提出的方法在非线性1自由度实验台上实现了成功的探索和稳定的策略收敛,验证了其在实际硬件上的有效性。相较于传统方法,该框架在安全性和性能上均有显著提升。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、无人机飞行等复杂的网络物理系统。在这些领域中,确保安全性是至关重要的,本文提出的方法能够有效地在保证安全的前提下进行学习和优化,具有重要的实际价值和未来影响。

📄 摘要(原文)

Reinforcement learning (RL) enables the synthesis of control policies directly from data, making it highly appealing for complex cyber-physical systems (CPSs) and robotics. A persistent challenge, however, is ensuring strict, hard safety constraints during the active learning phase. In real-world physical systems, violating mechanical limits can cause irreversible damage, necessitating that exploration remains strictly within safe operational regions. We propose a generalized framework that combines the adaptive, high-performance nature of deep reinforcement learning (DRL) with the formal safety guarantees of model predictive control (MPC). Using a mathematical model of the system dynamics, offline MPC computations define a feasible state-action space, representing all safe combinations of system states and control inputs that guarantee constraint satisfaction. During training and deployment, the RL agent's instantaneous actions are projected onto this globally verified feasible set via a safety filter. We systematically evaluate our generalized approach on a non-linear 1-DoF laboratory testbed, demonstrating successful exploration and stable policy convergence on physical hardware.