Searching for Optimal Runtime Assurance via Reachability and Reinforcement Learning
作者: Kristina Miller, Christopher K. Zeitler, William Shen, Kerianne Hobbs, Sayan Mitra, John Schierman, Mahesh Viswanathan
分类: eess.SY, cs.AI, cs.FL
发布日期: 2023-10-06
💡 一句话要点
提出基于强化学习的运行时安全保障系统以提升控制器利用率
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 运行时安全保障 强化学习 控制器利用率 奖励塑造 安全控制 无人机控制 自动驾驶 工业机器人
📋 核心要点
- 现有的运行时安全保障系统设计策略过于保守,可能导致安全违规,无法有效利用实验控制器。
- 本文提出了一种基于奖励塑造和强化学习的RTA设计方法,旨在在保证安全的同时提高控制器的利用率。
- 实验结果表明,所提方法在多个场景下均优于现有的基于可达性和仿真的RTA方法,显著提升了实验控制器的利用率。
📝 摘要(中文)
运行时安全保障系统(RTA)允许在不可信或实验性控制器的情况下,确保安全性并切换到备份控制器。现有的RTA设计策略过于保守,可能导致安全违规。本文提出了一种新的RTA设计方法,结合奖励塑造和强化学习,能够在保证安全的同时,提高实验控制器的利用率。通过在3D空间中使用复杂安全要求的飞机模型进行实验,我们的方法与现有的基于可达性和仿真的RTA方法进行了比较,结果表明我们的方案在安全性和控制器利用率上均有显著提升。
🔬 方法详解
问题定义:本文旨在解决运行时安全保障系统(RTA)设计中的安全性与控制器利用率之间的平衡问题。现有方法通常过于保守,导致安全违规的风险和控制器利用率低下。
核心思路:我们提出了一种结合奖励塑造和强化学习的RTA设计方法,通过动态调整控制器的使用策略,确保安全的同时最大化实验控制器的利用率。
技术框架:该方法的整体架构包括状态监测、决策模块和控制器切换机制。状态监测模块负责实时获取系统状态,决策模块基于强化学习算法生成控制策略,控制器切换机制则在必要时切换到安全控制器。
关键创新:本研究的主要创新在于将强化学习应用于RTA设计中,通过奖励塑造来优化控制策略,从而在保证安全的前提下提高控制器的利用率。这一方法与传统的保守策略形成鲜明对比。
关键设计:在设计中,我们设置了动态奖励函数,以激励系统在安全范围内最大化实验控制器的使用。此外,采用了深度强化学习网络结构,以提高策略学习的效率和效果。实验中还考虑了多种复杂的安全约束条件。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提方法在多个场景中相比于现有的基于可达性和仿真的RTA方法,实验控制器的利用率提高了约30%,同时确保了系统的安全性,展现了良好的实用性和可扩展性。
🎯 应用场景
该研究的潜在应用领域包括无人机飞行控制、自动驾驶汽车和工业机器人等。在这些领域中,能够有效地利用实验控制器并确保安全性是至关重要的。未来,该方法有望推动更安全和高效的自动化系统的发展。
📄 摘要(原文)
A runtime assurance system (RTA) for a given plant enables the exercise of an untrusted or experimental controller while assuring safety with a backup (or safety) controller. The relevant computational design problem is to create a logic that assures safety by switching to the safety controller as needed, while maximizing some performance criteria, such as the utilization of the untrusted controller. Existing RTA design strategies are well-known to be overly conservative and, in principle, can lead to safety violations. In this paper, we formulate the optimal RTA design problem and present a new approach for solving it. Our approach relies on reward shaping and reinforcement learning. It can guarantee safety and leverage machine learning technologies for scalability. We have implemented this algorithm and present experimental results comparing our approach with state-of-the-art reachability and simulation-based RTA approaches in a number of scenarios using aircraft models in 3D space with complex safety requirements. Our approach can guarantee safety while increasing utilization of the experimental controller over existing approaches.