Learning More from Less: Reinforcement Learning from Hindsight

📄 arXiv: 2607.09042v1 📥 PDF

作者: Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

分类: cs.LG

发布日期: 2026-07-10


💡 一句话要点

提出从失败中学习的方法以提升强化学习样本效率

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化学习 视觉-语言模型 样本效率 机器人操作 后见重标记 稀疏奖励 多模态学习

📋 核心要点

  1. 现有的强化学习方法在样本效率上存在显著不足,尤其是在处理稀疏奖励的操作任务时,弱策略往往无法从失败中学习。
  2. 论文提出了从后见中学习(LfH)的方法,通过对失败的轨迹进行重新标记,使得策略能够从同样的轨迹中学习更多信息。
  3. 在LIBERO-PRO任务上,LfH方法实现了5倍的样本效率提升,并且在物理Franka机器人上表现优于传统的稠密奖励基线。

📝 摘要(中文)

强化学习(RL)在视觉-语言-动作(VLA)模型的后训练中越来越多地被使用,但每次更新都需要耗费缓慢且昂贵的机器人轨迹,样本效率成为核心问题。操作任务通常只提供稀疏奖励,因此弱策略在训练初期几乎每次都失败,几乎没有可学习的内容。论文提出了“从后见中学习”(LfH),通过对失败的轨迹进行重新标记,将后见重标记引入到VLA的RL后训练中。该方法通过对失败轨迹进行评分,提出了一种后见指令,并联合训练重标记和原始轨迹。实验表明,在LIBERO-PRO任务上,LfH在样本效率上实现了5倍的提升,超越了稠密进展奖励的基线。

🔬 方法详解

问题定义:论文要解决的问题是强化学习在稀疏奖励环境中的样本效率低下,尤其是在操作任务中,弱策略在训练初期几乎无法从失败中获得有用的信息。现有方法在处理失败的轨迹时缺乏有效的学习机制。

核心思路:论文的核心思路是引入“从后见中学习”(LfH)的方法,通过对失败的轨迹进行重新标记,使得策略能够从这些失败中学习到有价值的信息。具体来说,LfH通过对失败轨迹进行评分,提出了一种后见指令,从而使得策略在训练时能够利用这些信息。

技术框架:整体架构包括两个主要模块:首先是失败轨迹的收集与评分,其次是基于这些评分进行的策略训练。具体流程是收集机器人执行任务的轨迹,识别失败的轨迹,然后通过视觉-语言模型对这些轨迹进行重新标记,最后将重标记的轨迹与原始轨迹联合用于策略训练。

关键创新:最重要的技术创新点在于将后见重标记引入到强化学习的后训练过程中,使得策略能够从失败中学习到有效的信息。这与现有方法的本质区别在于,现有方法通常忽视了失败轨迹的潜在价值,而LfH则通过重新标记使其变得有意义。

关键设计:在关键设计上,LfH使用了一个单一的视觉-语言模型来同时重标记指令和奖励,提出了一种后见指令,并对每个轨迹的满足程度进行评分。此外,损失函数的设计也考虑了重标记轨迹与原始轨迹的联合训练,以提高样本效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,LfH在LIBERO-PRO任务上实现了5倍的样本效率提升,显著优于传统的稠密进展奖励基线。这一成果在不同的VLA骨干网络和物理Franka机器人上均得到了验证,展示了LfH方法的广泛适用性和有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、自动化任务执行以及智能助手等。通过提升样本效率,LfH方法可以使得机器人在复杂环境中更快速地学习和适应,从而提高其在实际应用中的表现和效率。未来,该方法可能会对强化学习在多模态交互和自主学习领域的应用产生深远影响。

📄 摘要(原文)

Reinforcement learning (RL) is increasingly used to post-train vision-language-action (VLA) models, but every update consumes robot rollouts that are slow and costly to collect, making sample efficiency a central concern. Manipulation tasks typically provide only sparse rewards, so a weak policy fails almost every rollout early in training and has little to learn from, even when those failures execute coherent behavior. Such a failure, however, is a success at a different task. We present Learning from Hindsight (LfH), which brings hindsight relabeling to RL post-training of VLAs by scoring failed rollouts against the tasks they actually achieved. A single vision-language model relabels both the instruction and the reward, proposing a hindsight instruction for a group of failed rollouts and scoring how well each satisfies it, and the policy trains on the relabeled and original rollouts jointly. Because VLAs generalize across language, relabeling in language lets the policy learn more from the same trajectories. On out-of-distribution LIBERO-PRO tasks, where standard RL improves only slowly, LfH achieves $5\times$ improvement in sample efficiency, and outperforms a dense progress-reward baseline. The gains hold across VLA backbones and on a physical Franka robot.