DATT: Deep Adaptive Trajectory Tracking for Quadrotor Control
作者: Kevin Huang, Rwik Rana, Alexander Spitzer, Guanya Shi, Byron Boots
分类: cs.RO, cs.AI, eess.SY
发布日期: 2023-10-13 (更新: 2023-12-13)
💡 一句话要点
提出DATT以解决四旋翼精确轨迹跟踪问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 四旋翼控制 轨迹跟踪 自适应控制 强化学习 动态系统 无人机技术 模型预测控制
📋 核心要点
- 现有的四旋翼控制方法在面对未知的非线性动力学和轨迹不可行性时表现不佳,难以实现精确的轨迹跟踪。
- 本文提出的DATT方法结合了前馈、反馈和自适应控制结构,通过强化学习进行训练,能够有效应对复杂环境中的干扰。
- 实验结果表明,DATT在不稳定风场中对比传统控制方法有显著提升,尤其在处理不可行轨迹时表现优异。
📝 摘要(中文)
精确的四旋翼轨迹跟踪面临未知非线性动力学、轨迹不可行性和驱动限制等挑战。为此,本文提出了一种基于学习的方法——深度自适应轨迹跟踪(DATT),能够在存在大干扰的实际环境中精确跟踪任意、潜在不可行的轨迹。DATT基于一种新颖的前馈-反馈-自适应控制结构,通过强化学习在仿真中进行训练。在实际硬件上部署时,DATT通过闭环中的L1自适应控制增强了干扰估计器,无需任何微调。DATT在不稳定风场中显著优于竞争性的自适应非线性和模型预测控制器,尤其是在基线方法完全失效的挑战场景中。此外,DATT的在线推理时间小于3.2毫秒,低于自适应非线性模型预测控制基线的四分之一。
🔬 方法详解
问题定义:本文旨在解决四旋翼在未知非线性动力学和轨迹不可行性下的精确轨迹跟踪问题。现有方法在面对大干扰和复杂环境时,往往无法保证稳定性和准确性。
核心思路:DATT的核心思路是通过结合前馈、反馈和自适应控制机制,利用强化学习进行训练,从而实现对复杂轨迹的精确跟踪。该设计使得控制器能够在动态环境中自适应调整,增强了系统的鲁棒性。
技术框架:DATT的整体架构包括三个主要模块:前馈控制模块用于生成初始控制指令,反馈控制模块用于实时调整控制指令,干扰估计模块用于识别和补偿外部干扰。整个系统通过闭环控制实现高效的轨迹跟踪。
关键创新:DATT的主要创新在于其自适应控制结构,能够在没有微调的情况下直接在实际硬件上运行,显著提高了控制精度和鲁棒性。这与传统的模型预测控制方法形成鲜明对比,后者通常需要大量的参数调整。
关键设计:DATT采用了L1自适应控制技术作为干扰估计器,确保在动态环境中能够快速响应。此外,损失函数的设计考虑了轨迹跟踪的精度和稳定性,网络结构则经过优化以提高推理速度,确保在线推理时间小于3.2毫秒。
🖼️ 关键图片
📊 实验亮点
DATT在不稳定风场中的实验结果显示,其在处理可行和平滑轨迹时的性能显著优于传统的自适应非线性和模型预测控制器。在面对不可行轨迹的挑战场景中,DATT的表现更是超越了基线方法,推理时间低于3.2毫秒,提升幅度超过75%。
🎯 应用场景
DATT的研究成果在无人机控制、自动驾驶和机器人导航等领域具有广泛的应用潜力。其高效的轨迹跟踪能力能够提升无人机在复杂环境中的自主飞行能力,增强其在救援、物流等实际场景中的应用价值。未来,DATT的技术可以进一步扩展到多种类型的动态系统中,推动智能控制技术的发展。
📄 摘要(原文)
Precise arbitrary trajectory tracking for quadrotors is challenging due to unknown nonlinear dynamics, trajectory infeasibility, and actuation limits. To tackle these challenges, we present Deep Adaptive Trajectory Tracking (DATT), a learning-based approach that can precisely track arbitrary, potentially infeasible trajectories in the presence of large disturbances in the real world. DATT builds on a novel feedforward-feedback-adaptive control structure trained in simulation using reinforcement learning. When deployed on real hardware, DATT is augmented with a disturbance estimator using L1 adaptive control in closed-loop, without any fine-tuning. DATT significantly outperforms competitive adaptive nonlinear and model predictive controllers for both feasible smooth and infeasible trajectories in unsteady wind fields, including challenging scenarios where baselines completely fail. Moreover, DATT can efficiently run online with an inference time less than 3.2 ms, less than 1/4 of the adaptive nonlinear model predictive control baseline