Real-Time Motion Prediction via Heterogeneous Polyline Transformer with Relative Pose Encoding
作者: Zhejun Zhang, Alexander Liniger, Christos Sakaridis, Fisher Yu, Luc Van Gool
分类: cs.CV, cs.RO
发布日期: 2023-10-19
备注: Accepted by NeurIPS 2023
🔗 代码/项目: GITHUB
💡 一句话要点
提出KNARPE机制以解决自主驾驶中的运动预测效率问题
🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)
关键词: 运动预测 自主驾驶 变换器 相对姿态编码 K最近邻注意力 高效计算 智能交通
📋 核心要点
- 现有的运动预测方法在代理数量增加时面临高计算开销和可扩展性差的问题。
- 本文提出了KNARPE机制,通过相对姿态编码实现变换器的成对相对表示,从而提高运动预测的效率。
- 在Waymo和Argoverse-2数据集上的实验表明,HPTR在性能上优于现有的端到端方法,且无需昂贵的后处理。
📝 摘要(中文)
在自主驾驶系统的实际部署中,运动预测模块需要实时运行,以预测周围交通参与者的未来轨迹。现有的以代理为中心的方法在公共基准测试中表现出色,但在代理数量增加时,计算开销高且可扩展性差。为了解决这一问题,本文提出了一种新颖的注意力机制——K最近邻注意力与相对姿态编码(KNARPE),使得变换器能够使用成对的相对表示。基于KNARPE,本文还提出了异构折线变换器(HPTR),该框架在在线推理过程中支持异步令牌更新。通过在代理之间共享上下文并重用不变的上下文,我们的方法在效率上与以场景为中心的方法相当,同时在性能上与最先进的以代理为中心的方法相当。实验结果表明,HPTR在不进行昂贵的后处理或模型集成的情况下,在Waymo和Argoverse-2数据集上实现了优越的性能。
🔬 方法详解
问题定义:本文旨在解决自主驾驶系统中运动预测模块的实时性与可扩展性问题。现有的以代理为中心的方法在处理多个代理时,计算开销显著增加,导致效率低下。
核心思路:提出K最近邻注意力与相对姿态编码(KNARPE),使得变换器能够有效利用成对的相对表示,从而降低计算复杂度并提高预测效率。
技术框架:HPTR框架采用层次化结构,支持在线推理过程中的异步令牌更新。通过在多个代理之间共享上下文信息,显著提高了计算效率。
关键创新:KNARPE机制是本文的核心创新,允许变换器处理相对姿态信息,区别于传统方法的绝对位置表示,提升了模型的灵活性和适应性。
关键设计:在模型设计中,采用了共享上下文的策略,减少了重复计算,并通过优化损失函数和网络结构,确保了模型在实时性与准确性之间的平衡。
🖼️ 关键图片
📊 实验亮点
实验结果显示,HPTR在Waymo和Argoverse-2数据集上表现优越,尤其是在不使用昂贵的后处理或模型集成的情况下,性能提升显著,具体数值未提供,但相较于现有方法有明显的优势。
🎯 应用场景
该研究在自动驾驶、智能交通系统等领域具有广泛的应用潜力。通过提高运动预测的效率和准确性,可以显著提升自动驾驶系统的安全性和可靠性,推动智能交通的进一步发展。
📄 摘要(原文)
The real-world deployment of an autonomous driving system requires its components to run on-board and in real-time, including the motion prediction module that predicts the future trajectories of surrounding traffic participants. Existing agent-centric methods have demonstrated outstanding performance on public benchmarks. However, they suffer from high computational overhead and poor scalability as the number of agents to be predicted increases. To address this problem, we introduce the K-nearest neighbor attention with relative pose encoding (KNARPE), a novel attention mechanism allowing the pairwise-relative representation to be used by Transformers. Then, based on KNARPE we present the Heterogeneous Polyline Transformer with Relative pose encoding (HPTR), a hierarchical framework enabling asynchronous token update during the online inference. By sharing contexts among agents and reusing the unchanged contexts, our approach is as efficient as scene-centric methods, while performing on par with state-of-the-art agent-centric methods. Experiments on Waymo and Argoverse-2 datasets show that HPTR achieves superior performance among end-to-end methods that do not apply expensive post-processing or model ensembling. The code is available at https://github.com/zhejz/HPTR.