TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

📄 arXiv: 2609.09158v1 📥 PDF

作者: Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah

分类: cs.RO, cs.AI

发布日期: 2026-09-08


💡 一句话要点

提出TANGO以解决复杂环境中的类人机器人导航问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱四:生成式动作 (Generative Motion) 支柱六:视频提取与匹配 (Video Extraction) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 类人机器人 视觉-语言导航 全身运动控制 强化学习 复杂环境适应

📋 核心要点

  1. 现有方法将导航建模为2D路径规划,无法有效应对类人机器人在复杂环境中的全身适应需求。
  2. TANGO框架结合视觉和语言输入,能够直接预测类人机器人在复杂环境中的全身动作,提升导航能力。
  3. 在模拟实验中,TANGO在视觉-语言导航任务中表现出色,超越了传统模块化方法,展现了强大的环境适应能力。

📝 摘要(中文)

本研究探讨了在复杂室内环境中进行类人机器人导航的问题。与传统的2D路径规划方法不同,类人机器人在拥挤环境中的移动需要进行连续的几何感知全身适应,包括协调的手臂放置、躯干调整和步态调节,以实现无碰撞的复杂3D空间移动。我们提出了TANGO,这是首个用于语言条件下类人机器人在拥挤环境中导航的全身视觉-语言导航框架。TANGO能够根据自然语言指令和自我中心的RGB观察,直接预测29自由度的关节空间动作。该框架在模拟环境中完全训练,通过全局路径规划、运动生成、障碍物感知运动编辑和基于强化学习的跟踪合成多样的无碰撞移动行为。实验结果表明,TANGO在视觉-语言导航中表现出色,超越了强大的模块化基线,并在需要障碍物协商的复杂场景中表现优异。最后,我们在Unitree G1类人机器人上零-shot部署TANGO,观察到其在真实世界拥挤场景中的稳健语言引导移动。

🔬 方法详解

问题定义:本论文旨在解决类人机器人在拥挤室内环境中的导航问题。现有方法通常将导航视为2D路径规划,无法处理复杂的3D空间适应和全身协调问题。

核心思路:TANGO框架通过结合视觉和语言输入,直接预测类人机器人在复杂环境中的29自由度关节动作,从而实现更自然的导航。该设计使得机器人能够在接收到自然语言指令后,进行实时的动作调整。

技术框架:TANGO的整体架构包括多个模块:全局路径规划、运动生成、障碍物感知运动编辑和基于强化学习的跟踪。通过这些模块的协同工作,TANGO能够生成多样的无碰撞移动行为。

关键创新:TANGO的最大创新在于其全身视觉-语言导航框架,这是首个能够处理复杂环境中类人机器人导航的系统,突破了传统方法的限制。

关键设计:在训练过程中,TANGO采用了多样化的损失函数和网络结构,以确保生成的动作在动态环境中是可行的。关键参数设置包括29自由度的关节空间动作预测和障碍物感知机制。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在广泛的模拟实验中,TANGO在视觉-语言导航任务中达到了最先进的性能,相较于强大的模块化基线,成功提升了在复杂场景中的导航能力,展现出显著的障碍物协商能力。

🎯 应用场景

该研究的潜在应用领域包括智能家居、服务机器人和工业自动化等。TANGO能够在复杂环境中实现高效的导航,提升机器人在实际应用中的灵活性和适应性,未来可能在更多场景中得到广泛应用。

📄 摘要(原文)

We study the problem of navigating cluttered indoor environments with a humanoid robot. Unlike conventional methods that model navigation as a 2D path planning problem, humanoid traversal in cluttered environments requires continuous geometry-aware whole-body adaptation, including coordinated arm placement, torso adjustment, and gait modulation for collision-free movement through complex 3D spaces. We introduce TANGO, the first whole-body vision-language navigation framework for language-conditioned humanoid traversal in cluttered environments. Given a natural-language instruction and egocentric RGB observations, TANGO directly predicts 29-DoF joint-space actions for downstream whole-body control. We train TANGO entirely in simulation by synthesizing diverse collision-free traversal behaviors via global path planning, kinematic whole-body motion generation, obstacle-aware motion editing, and RL-based tracking. This pipeline provides dynamically feasible action supervision for learning language-conditioned whole-body policies. In extensive simulation experiments, TANGO demonstrates state-of-the-art performance in vision-language navigation, while outperforming strong modular baselines in navigating challenging scenes requiring obstacle negotiation. Lastly, we deploy TANGO zero-shot on a Unitree G1 humanoid robot, and observe robust language-guided traversal in cluttered real-world scenes without training on any real-world navigation data.