NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation
作者: Junjie An, Yi Wu, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, You Wang, Guang Li
分类: cs.RO
发布日期: 2026-07-16
备注: Accepted for presentation at IROS 2026
💡 一句话要点
提出NavCMPO以解决地图无关视觉导航中的推理延迟问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 视觉导航 强化学习 轨迹优化 机器人技术 障碍物规避 自适应导航
📋 核心要点
- 现有的基于扩散的导航策略在推理速度上存在显著延迟,且行为克隆方法受限于专家演示的质量。
- NavCMPO通过少步MeanFlow轨迹生成和评论指导的轨迹优化,结合强化学习微调,提出了一种新的自适应导航框架。
- 在InternVLA-N1基准测试中,NavCMPO的成功率达到74.7%,比基线提高6.4个百分点,并显著降低了推理延迟。
📝 摘要(中文)
基于扩散的端到端策略在地图无关视觉导航中表现出色,但其迭代去噪过程导致显著的推理延迟,而行为克隆又限制了性能。本文提出NavCMPO,一个结合少步MeanFlow轨迹生成、评论指导的轨迹优化和强化学习微调的两阶段自适应导航框架。在预训练阶段,通过障碍物接近预测任务,促进视觉表示捕捉障碍物感知的空间信息。为补偿少步生成导致的障碍物规避性能下降,采用评论指导的轨迹优化(CGTR)利用评论者的梯度来优化中间轨迹。在适应阶段,MeanFlow策略通过近端策略优化进行微调,同时更新评论者以适应特定的观察变化。在InternVLA-N1基准上,NavCMPO在相同训练预算下实现了74.7%的平均成功率,超越了重训练的NavDP基线6.4个百分点,同时将推理延迟从85毫秒降低至60毫秒。
🔬 方法详解
问题定义:本文旨在解决现有地图无关视觉导航策略在推理延迟和性能限制方面的挑战,尤其是基于扩散的策略在推理速度上的不足和行为克隆的局限性。
核心思路:NavCMPO框架通过结合少步MeanFlow轨迹生成和评论指导的轨迹优化,利用强化学习微调来提升导航性能,旨在提高障碍物规避能力和推理效率。
技术框架:该框架分为两个主要阶段:预训练阶段和适应阶段。在预训练阶段,进行障碍物接近预测以增强视觉表示;在适应阶段,使用近端策略优化对MeanFlow策略进行微调,同时更新评论者以适应新的观察变化。
关键创新:最重要的创新在于引入评论指导的轨迹优化(CGTR),通过评论者的梯度来优化中间轨迹,从而有效提升障碍物规避能力,区别于传统的行为克隆方法。
关键设计:在设计中,采用了特定的损失函数来平衡轨迹生成和评论指导的优化过程,同时在网络结构上,结合了视觉表示和评论者网络,以实现更好的性能。
🖼️ 关键图片
📊 实验亮点
NavCMPO在InternVLA-N1基准测试中实现了74.7%的成功率,超越了重训练的NavDP基线6.4个百分点,并将推理延迟从85毫秒降低至60毫秒,显示出显著的性能提升和效率优化。
🎯 应用场景
NavCMPO的研究成果在自主导航、机器人路径规划和智能交通系统等领域具有广泛的应用潜力。通过提升导航系统的效率和准确性,该框架可以在复杂环境中实现更安全和高效的自主移动,推动智能机器人技术的进步。
📄 摘要(原文)
End-to-end diffusion-based policies have demonstrated strong performance in mapless visual navigation, but their iterative denoising process introduces substantial inference latency, while behavior cloning limits performance to the quality of expert demonstrations. We present NavCMPO, a two-stage adaptive navigation framework that combines few-step MeanFlow trajectory generation, critic-guided refinement, and reinforcement learning fine-tuning. During pre-training, an obstacle proximity prediction task encourages the visual representation to capture obstacle-aware spatial information. To compensate for the degradation in obstacle avoidance caused by few-step generation, Critic-Guided Trajectory Refinement (CGTR) uses gradients from a critic trained with obstacle-point-cloud supervision to refine intermediate trajectories. During adaptation, the MeanFlow policy is fine-tuned using Proximal Policy Optimization with behavior-cloning regularization, while the critic is updated to accommodate embodiment-specific observation changes. Under a matched training budget on the InternVLA-N1 benchmark, NavCMPO achieves an average success rate of 74.7\%, exceeding the retrained NavDP baseline by 6.4 percentage points, while reducing inference latency from 85\,ms to 60\,ms. Experiments on a Unitree Go2 further demonstrate effective sim-to-real transfer.