Optimal Transport Q-Learning for Flow Policy Steering and Acceleration
作者: Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar
分类: cs.RO
发布日期: 2026-07-07
💡 一句话要点
提出最优传输Q学习以加速流政策优化
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 最优传输 Q学习 流政策 强化学习 机器人技术 多模态学习 政策微调
📋 核心要点
- 现有的流政策在快速推理和高质量示范方面存在不足,导致子最优行为和在分布变化下的失败。
- 本文提出最优传输Q学习(OTQL),通过优势加权条件最优传输流匹配来微调流政策,提升其性能。
- OTQL在50-60个交互预算内显著提高了政策成功率,并减少了推理步骤,展示了其在实际应用中的有效性。
📝 摘要(中文)
扩散和流政策在机器人应用中表现出色,能够准确捕捉多模态机器人轨迹分布。然而,高质量的政策性能需要快速推理和高质量的示范,这往往难以获得。本文提出了一种新的方法——最优传输Q学习(OTQL),用于通过强化学习后训练来微调和加速基于流的子最优政策。OTQL能够在50-60个交互预算内微调流政策,同时避免在仿真和真实机器人任务中计算开销大的蒸馏过程。实验结果表明,OTQL显著提高了单任务政策的平均成功率,从36%提升至86%,并将预训练的视觉语言行动(VLA)成功率从38%提升至76%,同时减少了每次动作生成的推理步骤70%。
🔬 方法详解
问题定义:本文旨在解决流政策在高质量示范和快速推理方面的不足,导致的子最优行为及在分布变化下的失败问题。现有方法在这些方面的表现不佳,限制了其在实际应用中的有效性。
核心思路:论文提出的最优传输Q学习(OTQL)通过利用机器人自身的经验进行后训练,微调流政策,旨在加速政策的优化过程。此方法通过优势加权条件最优传输流匹配,提升了流政策的性能。
技术框架:OTQL的整体架构包括数据收集、经验回放和流政策微调三个主要模块。首先,机器人通过与环境交互收集经验,然后利用这些经验进行后训练,最后微调流政策以提高其性能。
关键创新:OTQL的主要创新在于其结合了最优传输理论与Q学习,能够在较少的交互预算内实现高效的政策微调。这一方法与传统的蒸馏训练方法相比,显著降低了计算开销。
关键设计:OTQL在设计上采用了优势加权的条件最优传输流匹配,确保了流政策在微调过程中的有效性。此外,参数设置和损失函数的设计也经过精心调整,以适应不同的任务需求。
🖼️ 关键图片
📊 实验亮点
实验结果显示,OTQL显著提高了单任务政策的平均成功率,从36%提升至86%,而预训练的视觉语言行动(VLA)成功率从38%提升至76%。此外,OTQL还将每次动作生成的推理步骤减少了70%,展示了其在效率和效果上的显著提升。
🎯 应用场景
该研究的潜在应用领域包括机器人导航、自动化操作和人机交互等场景。通过提高流政策的性能和推理效率,OTQL能够在复杂环境中实现更高效的任务执行,具有重要的实际价值和广泛的应用前景。未来,OTQL可能会推动更多基于流政策的智能系统的发展,提升机器人在动态环境中的适应能力。
📄 摘要(原文)
Diffusion and flow policies have recently demonstrated remarkable performance in robotic applications by accurately capturing multimodal robot trajectory distributions, especially in the context of vision language action (VLA) models. However, high quality policy performance also requires fast inference and high quality demonstrations, which are often hard to get. Lack of these leads to suboptimal policy behaviors and failure under distribution shifts. In this work we address the problem of fine-tuning and accelerating suboptimal flow-based policies using the robot's experience through RL post-training. We introduce Optimal Transport Q-Learning (OTQL), a new method for finetuning flow policies using advantage weighted conditional optimal transport flow matching. OTQL can finetune and accelerate flows with an interaction budget of 50-60 episodes while avoiding computationally expensive distillation in simulation and real-world robot tasks. Our results show that OTQL post-trains flow policies using the robot's own experience, increasing average success percentage of single-task policies from 36% to 86% and of a pre-trained VLA from 38% to 76% while reducing the number of inference steps per action generation by 70%.