ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

📄 arXiv: 2607.21025v1 📥 PDF

作者: Shaomin Liang, Xuanhong Liao, Shiyao Zhang

分类: cs.RO

发布日期: 2026-07-23


💡 一句话要点

提出ZONDA框架以解决多层环境中的零-shot物体导航问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 零-shot学习 物体导航 动态避障 多层环境 视觉-语言模型 机器人导航 智能家居 服务机器人

📋 核心要点

  1. 现有物体导航方法通常只适用于静态单层环境,无法处理多层和动态行人场景,限制了其实际应用。
  2. ZONDA框架通过启发式多层规划、视觉-语言模型的多视角验证和动态行人避障,提供了一种新的解决方案。
  3. 在真实机器人和多种仿真环境中评估后,ZONDA在动态环境中的导航性能显著优于现有基线方法。

📝 摘要(中文)

在物体目标导航任务中,现有方法通常局限于静态单层环境,忽视了跨层拓扑和动态行人,这限制了其在现实世界中的应用。为了解决这些局限性,本文提出了ZONDA,一个具有动态避障能力的零-shot物体导航框架。ZONDA集成了三个核心组件:启发式多层规划、基于视觉-语言模型的多视角目标验证,以及动态行人避障。通过在真实的Direct Drive Tech TITA双足机器人和HM3D、MP3D的广泛仿真中进行评估,ZONDA显著提高了导航效果,并在动态基准HM3D-DYNA上保持了稳健的导航能力。

🔬 方法详解

问题定义:本文旨在解决现有物体导航方法在多层环境和动态行人场景中的局限性,现有方法无法有效处理跨层拓扑和动态障碍物。

核心思路:ZONDA框架通过结合启发式多层规划、视觉-语言模型的多视角验证和动态行人避障,提供了一种全面的解决方案,以实现更灵活和鲁棒的导航能力。

技术框架:ZONDA的整体架构包括三个主要模块:首先,启发式多层规划模块负责生成可行的跨层路径;其次,多视角目标验证模块通过视觉-语言模型对目标进行准确识别;最后,动态行人避障模块实时跟踪和预测行人位置,以避免碰撞。

关键创新:ZONDA的核心创新在于其启发式多层规划能力和动态行人避障机制,使其能够在复杂的多层环境中进行有效导航,这与传统方法的静态规划方式形成鲜明对比。

关键设计:在设计中,ZONDA采用了高度差可通行地图来支持楼梯穿越,使用多尺度观察进行目标验证,并通过预测模型来实现对动态行人的提前反应。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,ZONDA在真实的Direct Drive Tech TITA双足机器人上和HM3D、MP3D的仿真环境中表现出显著的性能提升。在动态基准HM3D-DYNA上,ZONDA的导航成功率和效率均显著高于现有基线,展示了其在复杂环境中的优势。

🎯 应用场景

ZONDA框架具有广泛的应用潜力,特别是在智能家居、服务机器人和自动驾驶等领域。其动态避障能力和多层导航能力使其能够在复杂的现实环境中有效工作,提升了机器人在实际应用中的安全性和可靠性。未来,ZONDA有望推动更智能的导航系统的发展,适应不断变化的环境和任务需求。

📄 摘要(原文)

In Object Goal Navigation task, existing methods are typically restricted to static and single-floor environments, ignoring cross-floor topologies and dynamic pedestrian, which limits their real-world deployment. To address these limitations, we propose ZONDA, a zero-shot object navigation with dynamic avoidance framework. In particular, ZONDA integrates three core components: (i) Heuristic multi-floor planning: from height-difference traversable maps, enables stair traversal and cross-floor exploration without a platform-specific learned controller; (ii) Multi-view target verification: cross-checks multi-scale observations with a vision-language model, significantly reducing false positives; and (iii) Dynamic pedestrian avoidance: explicitly tracks and predicts moving pedestrians to generate anticipatory behaviors. Evaluated on a real Direct Drive Tech TITA biped robot and extensive simulations on HM3D and MP3D, ZONDA achieves significantly improved results. Moreover, ZONDA can maintain robust navigation on the dynamic benchmark HM3D-DYNA compared to the existing baseline.