Human-in-the-Loop Task and Motion Planning for Imitation Learning

📄 arXiv: 2310.16014v1 📥 PDF

作者: Ajay Mandlekar, Caelan Garrett, Danfei Xu, Dieter Fox

分类: cs.RO, cs.AI, cs.CV, cs.LG

发布日期: 2023-10-24

备注: Conference on Robot Learning (CoRL) 2023


💡 一句话要点

提出人机协作任务与运动规划以提升模仿学习效率

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 模仿学习 人机协作 任务与运动规划 机器人控制 数据收集 高效代理 接触任务 长时间任务

📋 核心要点

  1. 现有模仿学习方法耗时且劳动密集,难以高效收集人类示范数据。
  2. 提出HITL-TAMP系统,通过人机协作优化任务与运动规划,提升数据收集效率。
  3. 实验表明,HITL-TAMP在相同时间内收集的示范数量超过传统系统三倍,且高效代理可通过少量数据训练获得。

📝 摘要(中文)

模仿学习通过人类示范教会机器人复杂的操作技能,但过程耗时且劳动密集。与此相对,任务与运动规划(TAMP)系统能够自动化解决长时间任务,但在接触丰富的任务中应用困难。本文提出了一种人机协作任务与运动规划(HITL-TAMP)系统,结合了两者的优点。该系统采用TAMP门控控制机制,选择性地将控制权交给人类遥控操作员,从而提高数据收集效率。收集到的人类数据与模仿学习框架结合,训练出TAMP门控策略,表现优于全任务示范的训练。与传统遥控系统相比,HITL-TAMP在相同时间预算下收集的示范数量超过三倍。此外,仅需10分钟的非专家遥控数据即可训练出成功率超过75%的高效代理。最终,我们在12个接触丰富的长时间任务中收集了2100个示范,系统常常能够生成近乎完美的代理。

🔬 方法详解

问题定义:本文旨在解决模仿学习中人类示范数据收集效率低下的问题。现有的模仿学习方法通常需要大量的人工示范,且在复杂的接触任务中难以应用。

核心思路:HITL-TAMP系统通过人机协作的方式,结合TAMP的自动化能力与人类的灵活性,优化了数据收集过程。系统设计了TAMP门控控制机制,使得人类遥控操作员可以在必要时接管控制,从而提高任务执行的效率。

技术框架:HITL-TAMP的整体架构包括数据收集模块、TAMP门控控制模块和模仿学习训练模块。数据收集模块负责从人类操作员那里获取示范,TAMP门控控制模块则根据任务需求动态调整控制权,模仿学习训练模块则利用收集到的数据训练高效的策略。

关键创新:HITL-TAMP的主要创新在于其TAMP门控控制机制,使得人类与机器人之间的协作更加高效,显著提高了数据收集的速度和质量。这一机制与传统的完全自动化或完全手动控制方法有本质区别。

关键设计:系统在设计时考虑了控制权的动态切换,确保在复杂任务中人类操作员能够及时介入。此外,采用了适应性损失函数和优化的网络结构,以提高模仿学习的效果。具体的参数设置和网络结构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,HITL-TAMP在相同时间预算下收集的示范数量超过传统遥控系统三倍。此外,仅需10分钟的非专家遥控数据即可训练出成功率超过75%的高效代理,证明了该系统在数据收集和学习效率上的显著提升。

🎯 应用场景

该研究的潜在应用领域包括工业机器人、服务机器人和自动化生产线等。通过提高模仿学习的效率,HITL-TAMP可以加速机器人技能的学习与应用,降低人力成本,提升生产效率。未来,该方法有望在更多复杂环境中得到应用,推动智能机器人技术的发展。

📄 摘要(原文)

Imitation learning from human demonstrations can teach robots complex manipulation skills, but is time-consuming and labor intensive. In contrast, Task and Motion Planning (TAMP) systems are automated and excel at solving long-horizon tasks, but they are difficult to apply to contact-rich tasks. In this paper, we present Human-in-the-Loop Task and Motion Planning (HITL-TAMP), a novel system that leverages the benefits of both approaches. The system employs a TAMP-gated control mechanism, which selectively gives and takes control to and from a human teleoperator. This enables the human teleoperator to manage a fleet of robots, maximizing data collection efficiency. The collected human data is then combined with an imitation learning framework to train a TAMP-gated policy, leading to superior performance compared to training on full task demonstrations. We compared HITL-TAMP to a conventional teleoperation system -- users gathered more than 3x the number of demos given the same time budget. Furthermore, proficient agents (75\%+ success) could be trained from just 10 minutes of non-expert teleoperation data. Finally, we collected 2.1K demos with HITL-TAMP across 12 contact-rich, long-horizon tasks and show that the system often produces near-perfect agents. Videos and additional results at https://hitltamp.github.io .