Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for Autonomous Real-World Reinforcement Learning

📄 arXiv: 2310.15145v1 📥 PDF

作者: Jingyun Yang, Max Sobol Mark, Brandon Vu, Archit Sharma, Jeannette Bohg, Chelsea Finn

分类: cs.RO, cs.AI, cs.LG

发布日期: 2023-10-23


💡 一句话要点

提出RoboFuME以解决机器人强化学习中的人工干预问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 机器人强化学习 无重置微调 预训练策略 视觉语言模型 自主学习 多任务操作 在线微调

📋 核心要点

  1. 现有的强化学习方法通常需要大量的人为干预,如手动奖励指定和环境重置,限制了其在实际应用中的效率。
  2. 本研究提出RoboFuME,通过无重置微调系统,利用互联网数据和模型,使机器人能够在极少人力干预下学习新任务。
  3. 在五个真实机器人操作任务中,RoboFuME在3小时的自主经验下显著提升了任务表现,展示了其有效性。

📝 摘要(中文)

机器学习中的预训练和微调范式在多个领域取得了显著成功。本研究旨在将这一范式应用于机器人强化学习,使机器人能够在极少的人为干预下学习新任务。我们提出了RoboFuME,一个无重置的微调系统,能够从多样化的先前经验数据集中预训练多任务操作策略,并在线自我改进以学习目标任务。通过利用校准的离线强化学习技术和预训练的视觉语言模型,我们的系统能够在存在分布变化的情况下高效地在线微调策略,并在五个真实机器人操作任务中展示了其优越性。实验结果表明,该方法在仅需3小时的自主真实世界经验下,能够显著提升目标任务的表现。

🔬 方法详解

问题定义:本研究旨在解决机器人强化学习中对人工干预的高依赖性,现有方法在奖励指定和环境重置方面存在显著不足,影响了学习效率和实用性。

核心思路:RoboFuME通过预训练多任务操作策略并在线自我改进,减少了对人工干预的需求。该方法利用校准的离线强化学习技术和预训练的视觉语言模型,确保在分布变化情况下的高效微调。

技术框架:RoboFuME的整体架构包括数据收集、预训练策略生成、在线微调和奖励信号生成四个主要模块。首先,从多样化的数据集中收集经验,然后进行策略的预训练,接着在目标任务中进行在线微调,最后通过视觉语言模型生成奖励信号。

关键创新:RoboFuME的核心创新在于无重置微调系统的设计,结合了离线强化学习和视觉语言模型,能够在不依赖人工干预的情况下实现高效的在线学习。这一设计与传统方法的本质区别在于其自我改进能力和对数据的高效利用。

关键设计:在技术细节上,RoboFuME采用了特定的损失函数来优化奖励分类器,并设计了适应性参数设置,以确保在不同任务和环境中的有效性。网络结构方面,结合了深度学习模型和强化学习框架,以实现最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,RoboFuME在五个真实机器人操作任务中表现出色,仅需3小时的自主经验便显著提升了任务表现。与使用不同强化学习算法的先前工作相比,该方法在奖励预测和任务执行效率上均表现出更优的性能,证明了其有效性。

🎯 应用场景

该研究的潜在应用场景包括自主机器人操作、智能制造和人机协作等领域。通过减少对人工干预的依赖,RoboFuME能够加速机器人在复杂环境中的学习过程,提升其在实际应用中的效率和灵活性。未来,该方法可能推动机器人技术的广泛应用,尤其是在动态和不确定的环境中。

📄 摘要(原文)

The pre-train and fine-tune paradigm in machine learning has had dramatic success in a wide range of domains because the use of existing data or pre-trained models on the internet enables quick and easy learning of new tasks. We aim to enable this paradigm in robotic reinforcement learning, allowing a robot to learn a new task with little human effort by leveraging data and models from the Internet. However, reinforcement learning often requires significant human effort in the form of manual reward specification or environment resets, even if the policy is pre-trained. We introduce RoboFuME, a reset-free fine-tuning system that pre-trains a multi-task manipulation policy from diverse datasets of prior experiences and self-improves online to learn a target task with minimal human intervention. Our insights are to utilize calibrated offline reinforcement learning techniques to ensure efficient online fine-tuning of a pre-trained policy in the presence of distribution shifts and leverage pre-trained vision language models (VLMs) to build a robust reward classifier for autonomously providing reward signals during the online fine-tuning process. In a diverse set of five real robot manipulation tasks, we show that our method can incorporate data from an existing robot dataset collected at a different institution and improve on a target task within as little as 3 hours of autonomous real-world experience. We also demonstrate in simulation experiments that our method outperforms prior works that use different RL algorithms or different approaches for predicting rewards. Project website: https://robofume.github.io