Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark

📄 arXiv: 2607.15935 📥 PDF

作者: Jonas Weihing, Shahram Eivazi

分类: cs.RO, cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出基于深度强化学习的复杂环境下的达避任务基准

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 深度强化学习 达避任务 机器人手臂 复杂环境 MuJoCo Brax 性能评估

📋 核心要点

  1. 现有方法在复杂和现实场景中应用时,深度强化学习(DRL)在达避任务中的学习能力存在不确定性。
  2. 本文提出了一个全面的达避任务基准,利用MuJoCo MJX物理引擎和Brax库实现模拟环境和DRL算法的并行化。
  3. 实验结果显示,UR5e和Franka Emika Robot在达成任务和静态达避任务中分别达到了96.1%和98.8%的成功率,显著提升了以往方法的性能。

📝 摘要(中文)

深度强化学习(DRL)在解决达避任务问题方面有着悠久的传统,尤其是在控制机器人手臂方面。尽管该任务在研究界作为基线环境,但DRL在复杂和现实场景中有效学习达避任务的能力仍不确定。本文首次提出了一个全面的达避任务基准,准确捕捉现实世界的复杂性。我们利用MuJoCo MJX物理引擎和Brax库对模拟环境和DRL算法进行并行化,展示了多种机器人手臂达避任务的设置,并取得了96.1%(UR5e)和98.8%(Franka Emika Robot)的达成率,以及86.8%(UR5e)和95.2%(Franka)的静态达避任务成功率。我们的结果表明,尽管以往工作中DRL代理在简化环境中表现良好,但在现实场景中的表现却显著下降。整体而言,该研究指出,仍需进一步研究以确认DRL在机器人手臂达避任务中的成功解决能力。

🔬 方法详解

问题定义:本文旨在解决深度强化学习在复杂现实场景中学习达避任务的能力不足的问题。现有方法在简化环境中表现良好,但在真实场景中却难以保持性能。

核心思路:论文的核心思路是构建一个全面的达避任务基准,真实模拟复杂环境,以便更好地评估DRL算法的性能。通过并行化模拟环境和算法,提升学习效率和效果。

技术框架:整体架构包括使用MuJoCo MJX物理引擎进行物理模拟,并通过Brax库实现DRL算法的并行化。主要模块包括环境构建、算法训练和性能评估。

关键创新:最重要的技术创新在于首次提出了一个真实复杂环境下的达避任务基准,解决了以往研究中简化环境带来的性能偏差问题。

关键设计:在参数设置上,采用了适合复杂环境的超参数,并设计了适应性损失函数,以提高学习效率。网络结构方面,结合了深度学习和强化学习的优势,优化了策略网络和价值网络的设计。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,UR5e和Franka Emika Robot在达成任务中的成功率分别达到了96.1%和98.8%,而在静态达避任务中则达到了86.8%和95.2%。这些结果显著高于以往研究,表明该基准在复杂环境下的有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人手臂的自动化控制、智能制造、以及复杂环境下的自主导航等。通过提供一个真实的评估基准,研究者可以更有效地开发和测试DRL算法,推动相关技术的实际应用和发展。

📄 摘要(原文)

Deep reinforcement learning (DRL) has a longstanding tradition in addressing the reach-avoid task problem, especially for controlling robotic arms. While this task serves as a baseline environment within the research community, the ability of DRL to effectively learn the each-avoid task in complex and realistic scenarios beyond simplified and restricted tabletop settings remains uncertain. In this paper, we present, for the first time, a comprehensive benchmark for the reachavoid task that accurately captures real-world complexities without simplifications. We demonstrate a diverse range of settings for robotic arm reach-avoid task, which can be used for evaluating DRL research. We achieved this by utilizing the MuJoCo MJX physics engine and parallelizing both the simulation environment and DRL algorithms using the Brax library. We achieved state-of-the-art results with success rates of 96.1% (UR5e) and 98.8% (Franka Emika Robot) for the reach task and 86.8% (UR5e) and 95.2% (Franka) for the static reachavoid task. Our results indicate that while in previous works DRL agents could solve, for example, a reach task in a simplified setting perfectly, their agents performance collapses when evaluated in realistic scenarios. Overall, this work identifies that additional research is still required to claim the successful resolution of the robotic arm reach-avoid task using DRL. The environment and benchmarking code is available as open source at the following link