Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation
作者: Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li
分类: cs.RO
发布日期: 2026-07-21
备注: 12 pages, 7 figures
💡 一句话要点
提出线性注意力策略以解决开放词汇目标导航问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 开放词汇导航 线性注意力 状态更新 机器人导航 智能体 性能提升 实际应用
📋 核心要点
- 现有基于Transformer的导航策略在状态集成时未能有效利用上下文信息,导致性能瓶颈。
- 提出线性注意力导航(LANav),通过线性注意力机制实现结构化的状态更新,提升导航性能。
- LANav在HM3D-OVON上实现36.4%的成功率,较基线提升6.3个百分点,且在实际应用中表现优异。
📝 摘要(中文)
开放词汇目标导航(OVON)要求智能体在部分可观测环境中操作,因此有效的内部状态更新对导航性能至关重要。现有方法多采用基于Transformer的自注意力机制进行状态集成,但实验表明性能未随上下文长度提升而提升,质疑了自注意力在导航中的适用性。为此,本文提出线性注意力导航(LANav),采用线性注意力作为策略骨干,保持结构化的状态更新。通过多种线性注意力变体的实验,LANav在多个基准上均优于Transformer基线,特别是在长距离任务中表现更佳。LANav在HM3D-OVON上实现了36.4%的平均成功率,较Transformer方法提升6.3个百分点,并在实际部署中表现出色。
🔬 方法详解
问题定义:本文旨在解决开放词汇目标导航中的状态更新问题,现有基于Transformer的方法在长上下文中性能未能提升,限制了导航效果。
核心思路:提出线性注意力机制替代自注意力,通过结构化的状态更新来提升导航性能,强调状态更新设计的重要性。
技术框架:LANav的整体架构包括线性注意力模块和加权状态扩展机制,前者用于状态更新,后者通过扩展每个注意力头的状态来增强信息整合。
关键创新:最重要的创新在于引入加权状态扩展线性注意力(WSLA),该方法通过学习加权聚合扩展的子状态,显著提升了状态更新的有效性。
关键设计:在WSLA中,每个注意力头的状态被扩展为多个子状态,并使用可学习的加权读出进行聚合,确保信息的有效整合与利用。整体设计保持了计算效率,适用于实际场景。
🖼️ 关键图片
📊 实验亮点
实验结果显示,LANav在HM3D-OVON上实现了36.4%的平均成功率,较Transformer基线提升6.3个百分点,特别是在长距离任务中表现更为突出。此外,LANav在Unitree Go2上的实际部署成功率达到82%,验证了其在真实环境中的有效性和鲁棒性。
🎯 应用场景
该研究的潜在应用领域包括机器人导航、智能家居系统和自动驾驶等。通过提升导航性能,LANav能够在复杂环境中更有效地执行任务,具有重要的实际价值和广泛的应用前景。未来,随着技术的进一步发展,LANav可能在更多实际场景中得到应用,推动智能体的自主导航能力。
📄 摘要(原文)
Open-Vocabulary Object Goal Navigation (OVON) requires agents to operate under partial observability, making effective internal state updates critical for navigation performance. This update is implemented by the policy network, where recent approaches adopt Transformer-based backbones with self-attention over a context window to integrate temporal information. However, our controlled experiments show that performance does not scale with context length under Transformer-based policies, questioning the suitability of self-attention for state integration in navigation. To this end, we propose Linear Attention-based Navigation (LANav), which adopts linear attention (LA) as the policy backbone to maintain a structured state update rather than self-attention over the context window. Across multiple LA variants evaluated under identical settings, LANav consistently outperforms Transformer-based baselines. Performance improves as state update mechanisms become more structured and regulated, highlighting the importance of state update design. To improve state update effectiveness, we introduce Weighted State-Expansion Linear Attention (WSLA), which expands each attention head's state into multiple sub-states and uses learnable weighted readout to aggregate expanded sub-states. Equipped with WSLA, LANav achieves 36.4% average success rate (SR) on HM3D-OVON, outperforming Transformer-based counterparts by 6.3 percentage points in macro-averaged SR, while maintaining computational efficiency. Distance-stratified results show larger gains in long-distance episodes, while HSSD transfer and fine-tuning demonstrate robustness across scene distributions. Real-world deployment on a Unitree Go2 further achieves an 82% success rate over 50 trials, supporting the practical feasibility and sim-to-real transfer of LANav.