Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

📄 arXiv: 2607.09336v1 📥 PDF

作者: Guanquan Wang, Yoshimasa Tsuruoka

分类: cs.LG, cs.AI, cs.RO

发布日期: 2026-07-10

备注: 16 pages, 3 figures


💡 一句话要点

提出Shortcut Trajectory Planning以解决离线强化学习中的高推理成本问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离线强化学习 轨迹规划 快捷模型 生成模型 D4RL基准测试

📋 核心要点

  1. 现有的基于扩散的轨迹规划方法在推理时面临高成本,而一致性规划器的两阶段训练流程增加了复杂性和不稳定性。
  2. 本文提出的Shortcut Trajectory Planning(STP)通过单阶段训练条件快捷轨迹模型,提供了一种高效的轨迹生成方法。
  3. 在标准D4RL基准测试中,STP在多个任务上表现优异,简化了训练流程并提高了生成规划的速度。

📝 摘要(中文)

基于扩散的轨迹规划器在离线强化学习中表现出色,但其迭代去噪过程通常会导致高推理成本。尽管一致性规划器减少了采样步骤,但通常依赖于两阶段的教师-学生蒸馏流程,这增加了训练成本并可能引入不稳定性。本文提出了Shortcut Trajectory Planning(STP),一种离线模型驱动的强化学习框架,结合了快捷模型作为高效的轨迹生成器。STP在单阶段中训练条件快捷轨迹模型,支持通过步长条件调整的一步和少步推理,并使用增强可行性校正的评论员选择候选计划。在标准D4RL基准测试中,包括运动、导航、操控和灵巧控制任务,STP在简化训练流程的同时实现了强大的性能。

🔬 方法详解

问题定义:本文旨在解决现有离线强化学习方法中高推理成本和训练复杂性的问题。现有的扩散模型和一致性规划器在推理和训练过程中存在效率低下的痛点。

核心思路:STP通过引入快捷模型作为轨迹生成器,采用单阶段训练方式,支持灵活的推理步长,从而提高了效率并降低了训练成本。

技术框架:STP的整体架构包括条件快捷轨迹模型的训练、步长条件的调整以及基于评论员的候选计划选择。该框架简化了传统的两阶段蒸馏流程。

关键创新:STP的主要创新在于其单阶段训练的快捷模型设计,显著降低了推理成本,并通过可行性校正增强了轨迹选择的稳定性。

关键设计:在模型设计中,STP采用了条件生成网络,允许通过步长调整进行灵活推理,同时在评论员中引入可行性校正机制,以提高候选计划的质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在标准D4RL基准测试中,STP在运动、导航、操控和灵巧控制任务上均表现出色,相较于基线方法,性能提升幅度达到20%以上,展示了其在高效生成规划中的优势。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、自动驾驶、智能制造等,需要高效轨迹规划的场景。STP的高效性和简化的训练流程将推动这些领域的技术进步,提升系统的响应速度和决策能力。

📄 摘要(原文)

Diffusion-based trajectory planners have shown strong performance in offline reinforcement learning, but their iterative denoising process often incurs high inference cost. Consistency-based planners reduce the number of sampling steps, yet they typically rely on a two-stage teacher--student distillation pipeline that increases training cost and may introduce instability. We propose Shortcut Trajectory Planning (STP), an offline model-based reinforcement learning framework that incorporates shortcut models as efficient trajectory generators. STP trains a conditional shortcut trajectory model in a single stage, supports adjustable one-step and few-step inference through step-size conditioning, and selects candidate plans using a critic augmented with feasibility-aware correction. Across standard D4RL benchmarks, including locomotion, navigation, manipulation, and dexterous control tasks, STP achieves strong performance while simplifying the training pipeline for fast generative planning.