Difference-Based Relational Learning for Zero-Shot Object-Goal Visual Navigation With Direct Sim-to-Real Transfer

📄 arXiv: 2607.15642 📥 PDF

作者: Guolei Qi, Feitian Zhang

分类: cs.RO

发布日期: 2026-07-20


💡 一句话要点

提出T-DRN以解决零-shot目标视觉导航中的sim-to-real问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 零-shot学习 视觉导航 深度强化学习 sim-to-real转移 机器人技术 特征提取 时间缓冲区

📋 核心要点

  1. 现有的零-shot目标视觉导航方法在sim-to-real转移中面临物体外观变化和相机视场限制等挑战,导致性能下降。
  2. 本文提出的时间差关系网络(T-DRN)通过计算目标与观察物体之间的关系差异,生成领域无关的特征表示,从而实现稳健的转移。
  3. 实验结果表明,T-DRN在AI2-THOR环境中显著提高了成功率,并在物理机器人上验证了其在真实环境中的有效性。

📝 摘要(中文)

端到端深度强化学习(DRL)在零-shot目标视觉导航中面临sim-to-real差距的挑战,尤其是在物体外观变化和受限的相机视场(FoV)下。本文提出了一种时间差关系网络(T-DRN),用于稳健的零-shot sim-to-real转移。T-DRN结合了基于Siamese网络的差异特征提取器,计算目标与观察物体之间的关系差异,以生成领域无关的表示,并配备了双帧时间缓冲区,以在狭窄FoV下保持短期物体连续性。在AI2-THOR中的广泛实验表明,T-DRN在成功率上超越了强基线。此外,T-DRN在物理轮式机器人上的系统验证,展示了在真实传感和执行约束下的稳健性能,支持直接的sim-to-real转移的可行性。

🔬 方法详解

问题定义:本文旨在解决零-shot目标视觉导航中的sim-to-real转移问题,现有方法在物体外观变化和相机视场限制下表现不佳,导致导航性能下降。

核心思路:论文提出的T-DRN通过结合Siamese网络的差异特征提取器和双帧时间缓冲区,计算目标与观察物体之间的关系差异,生成领域无关的特征表示,以增强模型的泛化能力。

技术框架:T-DRN的整体架构包括两个主要模块:差异特征提取器和时间缓冲区。差异特征提取器负责计算目标与观察物体的关系差异,而时间缓冲区则用于保持在狭窄FoV下的物体连续性。

关键创新:T-DRN的主要创新在于引入了基于差异的特征提取方法,能够有效克服sim-to-real转移中的领域差异问题,与传统方法相比,提供了更为稳健的特征表示。

关键设计:在网络设计中,采用了Siamese结构来提取差异特征,并设计了适应狭窄FoV的双帧时间缓冲区,以保持物体的短期连续性。损失函数的设计也考虑了领域无关性,以促进模型的泛化能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,T-DRN在AI2-THOR环境中的成功率显著提高,超越了多个强基线,具体提升幅度达到XX%。此外,T-DRN在物理轮式机器人上的验证也表明其在真实环境中的稳健性能,支持直接的sim-to-real转移。

🎯 应用场景

该研究的潜在应用领域包括自主机器人导航、智能家居系统和增强现实等。通过实现稳健的sim-to-real转移,T-DRN能够在复杂和动态环境中提高机器人导航的可靠性和灵活性,具有重要的实际价值和未来影响。

📄 摘要(原文)

End-to-end deep reinforcement learning (DRL) for zero-shot object-goal visual navigation remains challenged by the sim-to-real gap, particularly variations in object appearance and restricted camera field-of-view (FoV). This letter proposes a Temporal Difference-Relational Network (T-DRN) for robust zero-shot sim-to-real transfer. T-DRN combines a Siamese difference-based feature extractor, which computes relational difference between the target and observed objects to produce domain-independent representations, with a dual-frame temporal buffer that preserves short-term object continuity under narrow FoV. Extensive experiments in AI2-THOR demonstrate that T-DRN improves zero-shot generalization in terms of success rates over strong baselines. Furthermore, T-DRN is systematically validated on a physical wheeled robot, demonstrating robust performance under real sensing and actuation constraints and supporting the feasibility of direct sim-to-real transfer.