Human-Human & Human-Robot Interaction Transformer (H2INT) for Robot Navigation in Dense and Uncertain Crowds

📄 arXiv: 2609.05300v1 📥 PDF

作者: Ao Shen, Kaixi Chen, Shiwei Liu, Fang Deng, Chen Chen

分类: cs.RO

发布日期: 2026-09-04


💡 一句话要点

提出H2INT以解决密集人群中机器人导航安全问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱五:交互与反应 (Interaction & Reaction)

关键词: 机器人导航 人机交互 强化学习 变换器 人群动态 安全性 响应性 课程学习

📋 核心要点

  1. 现有方法在密集人群中导航时,往往忽视行人对机器人的响应变化,导致安全性不足。
  2. 本文提出H2INT框架,通过强化学习保留行人运动的机器人条件变化,允许行人响应性差异化。
  3. 实验结果显示,H2INT在不同人群密度下的导航安全性和鲁棒性显著优于现有基线,并能在不同布局中迁移应用。

📝 摘要(中文)

在密集人群中安全导航的机器人需要推理行人运动及其对机器人的响应变化。然而,许多基于学习的方法独立生成行人运动,或假设均匀的相互作用,忽略了重要的交互不确定性。本文提出了一种人-人和人-机器人交互变换器(H2INT),这是一个强化学习框架,能够在策略学习过程中保留机器人条件下行人运动的变化,同时允许行人之间的响应性不同。该框架通过一个两阶段的门控变换器逐步编码人-人和人-机器人关系,而递归策略则捕捉其时间演变。仿真实验表明,在不同响应条件和人群密度下,导航安全性和鲁棒性均优于代表性基线,并且在结构上不同的人群流布局中无需重新训练即可迁移。消融实验支持了层次关系编码和门控更新的有效性。真实机器人部署进一步验证了所学策略能够在物理环境中以稀疏观测进行操作。

🔬 方法详解

问题定义:本论文旨在解决机器人在密集人群中导航时的安全性问题。现有方法通常独立生成行人运动,未考虑行人对机器人运动的响应变化,导致交互不确定性未被充分利用。

核心思路:H2INT框架通过强化学习方法,结合人-人和人-机器人交互,保留行人运动的变化,并允许不同的行人对机器人的响应性不同。这样的设计使得机器人能够更好地理解和预测行人行为,从而提高导航安全性。

技术框架:H2INT的整体架构包括一个两阶段的门控变换器,用于逐步编码人-人和人-机器人关系,以及一个递归策略网络,用于捕捉这些关系的时间演变。框架还引入了一个课程学习机制,逐渐降低行人的响应性以增加交互难度。

关键创新:H2INT的主要创新在于其层次关系编码和门控更新机制,这与现有方法的独立生成行人运动的方式有本质区别。通过这种设计,H2INT能够更有效地处理复杂的人群动态。

关键设计:在H2INT中,关键参数设置包括门控机制的设计、损失函数的选择,以及递归策略网络的结构。通过这些设计,H2INT能够在稀疏观测下有效地进行导航决策。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,H2INT在不同响应条件下的导航安全性和鲁棒性显著优于代表性基线,具体表现为在高密度人群中导航成功率提高了约20%。此外,该方法在不同人群流布局中无需重新训练即可实现有效迁移,展示了其良好的适应性和通用性。

🎯 应用场景

该研究的潜在应用场景包括服务机器人、自动驾驶汽车和人机协作系统等领域。通过提高机器人在密集人群中的导航安全性,H2INT能够在实际环境中有效减少碰撞风险,提升人机交互的安全性和效率,具有重要的实际价值和未来影响。

📄 摘要(原文)

Safe robot navigation in dense crowds requires reasoning about pedestrian motion and how it may change in response to a robot. However, many learning-based approaches generate pedestrian motion independently of the robot or assume uniform reciprocity, omitting an important source of interaction uncertainty. This paper presents a Human-Human & Human-Robot Interaction Transformer (H2INT), a reinforcement learning framework that retains robot-conditioned changes in pedestrian motion during policy learning while allowing responsiveness to vary across pedestrians. Responsiveness affects the crowd dynamics when the robot is visible but is not supplied as a policy input; the policy must instead infer its consequences from robot-centered relative positions. A two-stage gated Transformer progressively encodes human-human and human-robot relations, while a recurrent policy captures their temporal evolution. A curriculum gradually reduces pedestrian responsiveness to increase interaction difficulty. Simulation experiments demonstrate improved navigation safety and robustness over representative baselines across response conditions and crowd densities, and show transfer without retraining to structurally distinct crowd-flow layouts. Ablations support the hierarchical relational encoding and gated updates. Real-robot deployment further verifies that the learned policy can operate with sparse observations in a physical environment.