SLAC: Safe and Efficient Real-Robot Reinforcement Learning via Unsupervised Simulation Pre-Training

📄 arXiv: 2506.04147 📥 PDF

作者: Jiaheng Hu, Peter Stone, Roberto Martín-Martín

分类: cs.RO, cs.AI, cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出SLAC以解决高自由度机器人强化学习的安全与效率问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 机器人控制 无监督学习 技能发现 高自由度系统 安全探索 样本效率

📋 核心要点

  1. 现有的强化学习方法在高自由度机器人控制中面临安全探索和样本效率低下的挑战。
  2. SLAC通过低保真度模拟器预训练潜在动作空间,并采用无监督技能发现方法,促进高效学习。
  3. SLAC在双手移动操控任务中实现了最先进的性能,且在真实世界交互中学习速度极快。

📝 摘要(中文)

构建高效的家庭和工业机器人需要掌握复杂的高自由度系统控制。尽管强化学习(RL)在自主获取机器人控制策略方面具有潜力,但在高自由度环境中应用时面临挑战。直接在现实世界中进行RL探索既需要安全性又需要高样本效率,这在实践中难以实现。本文提出SLAC方法,通过低保真度模拟器预训练任务无关的潜在动作空间,使得复杂机器人在现实世界中的RL变得可行。SLAC利用定制的无监督技能发现方法促进时间抽象、解耦和安全性,从而提高下游学习的效率。实验表明,SLAC在双手移动操控任务中表现出色,能够在不到一小时的真实世界交互中学习接触丰富的全身任务,无需任何演示或手工设计的行为先验。

🔬 方法详解

问题定义:本文旨在解决高自由度机器人在现实世界中进行强化学习时的安全性和样本效率问题。现有方法在实际应用中往往难以平衡探索的安全性与学习的效率,导致学习过程缓慢且不可靠。

核心思路:SLAC的核心思路是利用低保真度模拟器预训练一个任务无关的潜在动作空间,以促进安全和高效的学习。通过无监督技能发现方法,SLAC能够在不依赖于演示或手工设计的行为先验的情况下,快速学习复杂任务。

技术框架:SLAC的整体架构包括两个主要阶段:首先,通过低保真度模拟器进行潜在动作空间的预训练;其次,利用学习到的潜在动作空间作为动作接口,结合新颖的离线策略强化学习算法进行下游任务学习。

关键创新:SLAC的主要创新在于其无监督技能发现方法,能够有效促进时间抽象和解耦,显著提高学习效率。这一方法与传统的依赖于大量标注数据的强化学习方法有本质区别。

关键设计:SLAC在设计中使用了特定的损失函数来促进技能的多样性和安全性,同时在网络结构上采用了适应性模块,以便于在不同任务中进行迁移学习。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

SLAC在双手移动操控任务中表现出色,能够在不到一小时的真实世界交互中学习接触丰富的全身任务,且在性能上超越了现有方法,展示了显著的学习效率提升。

🎯 应用场景

该研究的潜在应用领域包括家庭服务机器人、工业自动化和医疗机器人等。通过提高机器人在复杂环境中的学习效率和安全性,SLAC有望推动机器人技术的广泛应用,提升人机协作的智能化水平。

📄 摘要(原文)

Building capable household and industrial robots requires mastering the control of versatile, high-degree-of-freedom (DoF) systems such as mobile manipulators. While reinforcement learning (RL) holds promise for autonomously acquiring robot control policies, scaling it to high-DoF embodiments remains challenging. Direct RL in the real world demands both safe exploration and high sample efficiency, which are difficult to achieve in practice. Sim-to-real RL, on the other hand, is often brittle due to the reality gap. This paper introduces SLAC, a method that renders real-world RL feasible for complex embodiments by leveraging a low-fidelity simulator to pretrain a task-agnostic latent action space. SLAC trains this latent action space via a customized unsupervised skill discovery method designed to promote temporal abstraction, disentanglement, and safety, thereby facilitating efficient downstream learning. Once a latent action space is learned, SLAC uses it as the action interface for a novel off-policy RL algorithm to autonomously learn downstream tasks through real-world interactions. We evaluate SLAC against existing methods on a suite of bimanual mobile manipulation tasks, where it achieves state-of-the-art performance. Notably, SLAC learns contact-rich whole-body tasks in under an hour of real-world interactions, without relying on any demonstrations or hand-crafted behavior priors. More information and robot videos atthis http URL