Terrain-Aware Quadrupedal Locomotion via Reinforcement Learning

📄 arXiv: 2310.04675v2 📥 PDF

作者: Haojie Shi, Qingxu Zhu, Lei Han, Wanchao Chi, Tingguang Li, Max Q. -H. Meng

分类: cs.RO

发布日期: 2023-10-07 (更新: 2023-10-11)


💡 一句话要点

提出一种新方法以实现四足机器人在复杂地形中的自适应运动

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 四足机器人 强化学习 地形感知 深度神经网络 运动控制 能量效率 自适应运动

📋 核心要点

  1. 现有方法在复杂地形中缺乏有效的适应能力,导致机器人运动不安全且能耗高。
  2. 本文提出了一种结合本体感知与外部感知的深度神经网络策略,能够动态调整轨迹生成器参数以适应不同地形。
  3. 通过在模拟和真实环境中进行实验,验证了该方法在复杂地形中的有效性,机器人能够灵活移动并节省能量。

📝 摘要(中文)

在自然界中,腿足动物通过感知能力适应复杂地形,从而提前规划安全的身体和足部轨迹,实现安全且节能的运动。受此启发,本文提出了一种新颖的方法,通过训练深度神经网络(DNN)策略,结合本体感知和外部感知状态,以及参数化轨迹生成器,使四足机器人能够在崎岖地形中行走。我们的核心思想是使用DNN策略来调整轨迹生成器的参数,如足部高度和频率,以适应不同的地形。为了鼓励机器人踏上安全区域并节省能量,我们分别提出了足部地形奖励和抬脚高度奖励。通过结合这些奖励,我们的方法能够学习到更安全、更高效的地形感知运动策略,使四足机器人能够灵活地朝任意方向移动。我们在包括楼梯、踏脚石和杆子等挑战性地形上进行了模拟实验,结果表明该方法能够成功引导机器人在这些复杂地形中移动。此外,我们还在真实的腿足机器人上验证了该方法,使其能够跨越超过25.5厘米间隙的踏脚石。

🔬 方法详解

问题定义:本文旨在解决四足机器人在复杂地形中运动时的适应性不足问题。现有方法往往无法有效应对不同地形的挑战,导致运动不安全且能耗高。

核心思路:我们提出了一种新颖的深度神经网络(DNN)策略,能够根据地形的变化动态调整轨迹生成器的参数,如足部高度和频率。这种设计灵感来源于自然界中动物的运动适应能力。

技术框架:整体架构包括一个深度神经网络策略模块和一个参数化轨迹生成器。DNN策略接收本体感知和外部感知状态,输出调整后的轨迹参数,从而实现对复杂地形的适应。

关键创新:本研究的主要创新在于引入了足部地形奖励和抬脚高度奖励,鼓励机器人选择安全区域并优化能量消耗。这一方法与传统的运动控制策略相比,显著提高了机器人的安全性和效率。

关键设计:在网络结构上,我们设计了多层感知器以处理输入的感知状态,并通过特定的损失函数来优化奖励机制。此外,参数设置方面,我们根据不同地形的特性调整了足部高度和频率的初始值,以确保机器人能够灵活应对各种挑战。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的方法在模拟环境中成功引导机器人在楼梯、踏脚石和杆子等复杂地形中灵活移动,且在真实环境中,机器人能够跨越超过25.5厘米的间隙,展示了显著的适应能力和运动效率。

🎯 应用场景

该研究具有广泛的应用潜力,特别是在搜索与救援、探索未知环境以及军事领域等需要机器人在复杂地形中灵活移动的场景。通过提高四足机器人的适应能力,可以显著提升其在实际应用中的效率和安全性,未来可能推动相关领域的技术进步。

📄 摘要(原文)

In nature, legged animals have developed the ability to adapt to challenging terrains through perception, allowing them to plan safe body and foot trajectories in advance, which leads to safe and energy-efficient locomotion. Inspired by this observation, we present a novel approach to train a Deep Neural Network (DNN) policy that integrates proprioceptive and exteroceptive states with a parameterized trajectory generator for quadruped robots to traverse rough terrains. Our key idea is to use a DNN policy that can modify the parameters of the trajectory generator, such as foot height and frequency, to adapt to different terrains. To encourage the robot to step on safe regions and save energy consumption, we propose foot terrain reward and lifting foot height reward, respectively. By incorporating these rewards, our method can learn a safer and more efficient terrain-aware locomotion policy that can move a quadruped robot flexibly in any direction. To evaluate the effectiveness of our approach, we conduct simulation experiments on challenging terrains, including stairs, stepping stones, and poles. The simulation results demonstrate that our approach can successfully direct the robot to traverse such tough terrains in any direction. Furthermore, we validate our method on a real legged robot, which learns to traverse stepping stones with gaps over 25.5cm.