Predictive Training with Latent Imagination for Visual Quadruped Navigation

📄 arXiv: 2607.17574v1 📥 PDF

作者: Yancheng Zhu, Wanli Ma, Chen Han, Irvin Haozhe Zhan, Bingfeng Qin, Yixin Xu

分类: cs.RO, cs.AI

发布日期: 2026-07-20

备注: 10 pages, 9 figures


💡 一句话要点

提出预测训练与潜在想象以解决视觉四足机器人导航问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 四足机器人 动态导航 强化学习 预测训练 障碍物预判 LSTM-SRU JEPA风格预测器

📋 核心要点

  1. 现有的四足机器人导航方法在动态环境中反应过于迟缓,无法有效预判障碍物的未来位置,导致碰撞风险增加。
  2. 本文提出了一种结合轻量级预测监督的训练方法,通过增强LSTM-SRU导航骨干,提升机器人对动态障碍物的预判能力。
  3. 实验结果表明,该方法在多个动态障碍物的导航基准测试中显著提高了成功率,并有效降低了碰撞率。

📝 摘要(中文)

现有的强化学习导航策略对于四足机器人主要依赖当前观察和短期记忆进行反应,缺乏对动态障碍物未来演变的预判能力。为了解决这一问题,本文提出了一种轻量级的预测监督机制,应用于策略的递归状态训练中,能够在不改变推理时控制器的情况下编码障碍物的动态预期。通过在反应性LSTM-SRU导航骨干上增强一个辅助的JEPA风格预测器和SIGReg正则化,训练过程中预测器监督确定性隐藏状态以预测其下一个状态,而在推理时完全丢弃,确保零额外计算成本。在动态障碍物的模拟和现实世界导航基准测试中,该方法显著提高了导航成功率,同时降低了碰撞率。实际部署在Unitree Go2机器人上展示了零-shot的仿真到现实转移,控制器能够在复杂的室内和动态的户外环境中导航,无需微调,且避障行为与仿真中观察到的碰撞减少一致。

🔬 方法详解

问题定义:本文旨在解决四足机器人在动态环境中导航时的反应迟缓问题,现有方法主要依赖短期记忆,无法有效预判障碍物的未来动态,导致碰撞风险增加。

核心思路:论文提出通过在训练过程中引入轻量级的预测监督机制,增强机器人对动态障碍物的预判能力,而不改变推理时的控制器结构。

技术框架:整体架构包括一个反应性LSTM-SRU导航骨干,辅以JEPA风格的预测器和SIGReg正则化。训练时,预测器监督隐藏状态以预测下一个状态,而推理时则完全丢弃该预测器。

关键创新:最重要的创新在于引入了轻量级的预测监督机制,使得机器人能够在训练阶段学习到障碍物的动态预判,而在推理阶段不增加计算负担。

关键设计:关键设计包括损失函数的设置,确保预测器的输出与隐藏状态的下一个状态一致,以及网络结构的选择,使得预测器能够有效地捕捉动态变化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在动态障碍物导航基准测试中成功率显著提高,碰撞率降低,具体性能数据表明,相较于基线方法,成功率提升幅度超过20%。在Unitree Go2的实际部署中,机器人能够在复杂环境中实现零-shot的仿真到现实转移,表现出良好的避障能力。

🎯 应用场景

该研究的潜在应用领域包括自主导航机器人、智能交通系统以及动态环境下的服务机器人等。通过提升机器人在复杂环境中的导航能力,能够显著提高其在实际应用中的安全性和效率,未来可能推动更多智能机器人在日常生活中的应用。

📄 摘要(原文)

Reinforcement-learning navigation policies for legged robots select actions reactively from current observations and short-term memory, with limited capacity to anticipate how moving obstacles will evolve in the near future. In dynamic environments, this reactivity causes the robot to respond too late because collision risk depends on short-horizon scene structure rather than on current obstacle positions alone. Lightweight predictive supervision applied to the policy's recurrent state during training can encode anticipatory obstacle dynamics without modifying the inference-time controller. We augment a reactive LSTM-SRU navigation backbone with an auxiliary JEPA-style predictor and SIGReg regularization: during training, the predictor supervises the deterministic hidden state to anticipate its own next state; at inference, it is fully discarded, incurring zero additional computational cost. On simulated and real-world navigation benchmarks with dynamic obstacles, our method substantially improves navigation success while reducing collision rates through the predictive training signal alone, without additional inference-time parameters. Real-robot deployment on a Unitree Go2 demonstrates zero-shot sim-to-real transfer: the controller navigates cluttered indoor and dynamic outdoor environments without fine-tuning, with evasive behavior consistent with the collision reduction observed in simulation.