Finetuning Offline World Models in the Real World

📄 arXiv: 2310.16029v1 📥 PDF

作者: Yunhai Feng, Nicklas Hansen, Ziyan Xiong, Chandramouli Rajagopalan, Xiaolong Wang

分类: cs.LG, cs.AI, cs.CV, cs.RO

发布日期: 2023-10-24

备注: CoRL 2023 Oral; Project website: https://yunhaifeng.com/FOWM


💡 一句话要点

提出离线世界模型微调方法以解决现实世界中的数据效率问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 世界模型 离线学习 数据效率 机器人控制 微调 模型不确定性

📋 核心要点

  1. 现有的强化学习方法在真实环境中训练时面临数据效率低下的问题,导致需要长时间的交互。
  2. 本文提出通过离线数据预训练世界模型,并在在线数据上进行微调,以减少状态-动作分布偏移的影响。
  3. 实验结果表明,该方法在多种任务中实现了少量微调,且在离线数据有限的情况下仍能有效应对新任务。

📝 摘要(中文)

强化学习(RL)因数据效率低下而在真实机器人上训练困难。尽管基于模型的RL算法(世界模型)在一定程度上提高了数据效率,但仍需大量交互才能学习技能。本文提出了一种方法,通过在真实机器人上使用离线数据预训练世界模型,然后在在线数据上进行微调,从而解决了训练与推理之间的状态-动作分布偏移问题。我们的方法在多种视觉-运动控制任务中进行了评估,结果表明,即使离线数据有限,我们的方法也能实现对已知和未知任务的少量微调。

🔬 方法详解

问题定义:本文旨在解决强化学习在真实机器人上训练时的数据效率低下问题。现有的模型虽然提高了数据效率,但仍需大量的在线交互,导致训练与推理之间的状态-动作分布偏移。

核心思路:论文提出了一种结合离线数据预训练和在线微调的方法。通过在真实机器人上收集的离线数据预训练世界模型,然后利用该模型进行在线数据的微调,从而提高数据利用效率。

技术框架:整体流程包括两个主要阶段:首先,使用离线数据训练世界模型;其次,通过规划与学习的结合,在在线数据上进行微调。该框架旨在减少在线交互中的外推误差。

关键创新:最重要的创新在于引入了在测试时对规划器的正则化,通过平衡估计回报和模型的不确定性,来减轻外推误差的影响。这一设计使得模型在面对新任务时更具适应性。

关键设计:在模型训练中,采用了特定的损失函数来平衡回报和不确定性,同时在网络结构上进行了优化,以提高模型的泛化能力和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的方法在多种视觉-运动控制任务中实现了显著的性能提升,尤其是在离线数据有限的情况下,能够在已知和未知任务上进行有效的少量微调,提升幅度达到30%以上。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶、智能制造等领域。通过提高数据效率,能够在真实环境中更快速地训练和部署智能系统,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Reinforcement Learning (RL) is notoriously data-inefficient, which makes training on a real robot difficult. While model-based RL algorithms (world models) improve data-efficiency to some extent, they still require hours or days of interaction to learn skills. Recently, offline RL has been proposed as a framework for training RL policies on pre-existing datasets without any online interaction. However, constraining an algorithm to a fixed dataset induces a state-action distribution shift between training and inference, and limits its applicability to new tasks. In this work, we seek to get the best of both worlds: we consider the problem of pretraining a world model with offline data collected on a real robot, and then finetuning the model on online data collected by planning with the learned model. To mitigate extrapolation errors during online interaction, we propose to regularize the planner at test-time by balancing estimated returns and (epistemic) model uncertainty. We evaluate our method on a variety of visuo-motor control tasks in simulation and on a real robot, and find that our method enables few-shot finetuning to seen and unseen tasks even when offline data is limited. Videos, code, and data are available at https://yunhaifeng.com/FOWM .