Joint On-and-Off Policy Learning for Vision-and-Language Navigation
作者: Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin
分类: cs.RO
发布日期: 2026-07-15
备注: Accepted by IROS 2026
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出JOP-VLN以解决视觉与语言导航中的策略整合问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉与语言导航 模仿学习 强化学习 策略整合 高熵采样 错误恢复 智能体导航
📋 核心要点
- 现有的视觉与语言导航方法在模仿学习和强化学习之间缺乏有效的整合,导致导航能力和错误恢复能力不足。
- 本文提出的JOP-VLN框架通过三阶段训练流程,结合离线模仿学习和在线探索,提升了智能体的导航能力。
- 实验结果显示,JOP-VLN在VLN-CE R2R和RxR基准上分别取得69.9%和68.0%的成功率,刷新了R2R的最新记录。
📝 摘要(中文)
视觉与语言导航(VLN)要求具身智能体根据自然语言指令在物理世界中导航。现有的VLN方法主要基于模仿学习和强化学习两种范式,但缺乏有效的整合。本文提出了JOP-VLN框架,结合了离线模仿学习和在线探索,采用三阶段训练流程,显著提升了导航能力和错误恢复能力。实验结果表明,JOP-VLN在VLN-CE R2R和RxR基准上分别达到了69.9%和68.0%的成功率,创造了R2R的新状态。
🔬 方法详解
问题定义:本文旨在解决视觉与语言导航中模仿学习与强化学习之间的整合问题。现有方法在错误恢复和探索能力上存在不足,影响了导航效果。
核心思路:JOP-VLN框架通过三阶段训练流程,首先利用模仿学习获取基本导航技能,然后通过DAgger算法生成启发式探索轨迹,最后结合离线模仿学习和在线强化学习进行联合训练,以提升整体性能。
技术框架:该框架包括三个主要阶段:第一阶段为模仿学习,使用专家演示数据;第二阶段为DAgger算法生成的探索轨迹;第三阶段为联合的在线和离线策略学习,采用高熵轨迹采样和错误纠正优先级排序策略。
关键创新:JOP-VLN的主要创新在于将离线模仿学习与在线强化学习有效结合,形成一个统一的训练框架,显著提高了智能体的导航能力和错误恢复能力。
关键设计:在设计中,采用高熵轨迹采样以增强强化学习的训练效率,并引入错误纠正优先级排序策略,以确保有效的错误修正。
🖼️ 关键图片
📊 实验亮点
JOP-VLN在VLN-CE R2R和RxR基准上分别达到了69.9%和68.0%的成功率,显著优于现有方法,刷新了R2R的最新记录,展示了其在视觉与语言导航任务中的有效性。
🎯 应用场景
该研究的潜在应用领域包括智能家居、机器人导航和增强现实等场景。通过提升智能体在复杂环境中的导航能力,JOP-VLN能够为用户提供更自然的交互体验,推动智能系统的实际应用和发展。
📄 摘要(原文)
Vision-and-Language Navigation (VLN) necessitates an embodied agent to navigate in the physical world by adhering to natural language instructions. Recent advancements in Vision-Language Models (VLM) have propelled the development of VLM-based VLN methods with two predominant paradigms: (1) imitation learning (IL) on expert demonstrations, followed by the Dataset Aggregation (DAgger) algorithm to bolster error recovery capabilities; (2) reinforcement learning (RL) driven by verifiable rewards to enhance reasoning and exploration. A notable gap is the absence of integration between these two distinct paradigms. This paper introduces JOP-VLN, a novel VLN framework that synergistically combines off-policy imitation learning and on-policy exploration within a three-stage training pipeline. Initially, IL is employed on expert demonstrations to acquire basic navigation skills. Subsequently, the DAgger algorithm is utilized to generate heuristic exploration trajectories, which are then used for imitation learning to improve error recovery capabilities. Finally, a joint on-and-off policy learning framework is implemented, featuring high-entropy trajectory sampling to enhance RL training efficiency and an error-correction-prioritized trajectory sorting strategy for effective error correction. Extensive experiments demonstrate the efficacy of JOP-VLN, achieving success rates of 69.9% and 68.0% on the VLN-CE R2R and RxR benchmarks, respectively, setting a new state-of-the-art on R2R. Project page: https://qingrongh.github.io/JOP-VLN.