GeoWorldAD: Geometry World Action Model for Autonomous Driving
作者: Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv
分类: cs.RO
发布日期: 2026-07-20
💡 一句话要点
提出GeoWorldAD以解决自主驾驶中的几何基础规划问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 自主驾驶 几何基础 轨迹规划 动态环境 未来几何 安全性 效率提升
📋 核心要点
- 现有的视觉/视频动作模型在动态环境中缺乏几何基础,导致碰撞避免与行驶效率之间的平衡不足。
- GeoWorldAD通过在自我对齐的三维空间中进行轨迹规划,并引入潜在的未来几何标记,来解决这一问题。
- 在NAVSIM v1和v2上的实验结果显示,GeoWorldAD在安全性和效率上均优于现有方法,展现出显著的性能提升。
📝 摘要(中文)
自主驾驶需要在动态三维环境中做出安全且高效的规划决策。尽管近期的视觉/视频动作模型能够直接从视觉观察中学习策略,并随着视觉变换器和大规模训练数据的进步而扩展,但它们往往缺乏明确的几何基础和未来感知的空间指导,限制了其在避免碰撞与行驶进度之间的平衡。本文提出了GeoWorldAD,一个几何世界动作模型,将轨迹规划基于自我对齐的三维空间,并通过潜在的未来几何标记预测短期场景演变。当前几何为安全规划提供了重要的空间约束,而未来几何则揭示了周围代理和自我中心自由空间的演变,减少了过于保守的决策而不牺牲安全性。实验结果表明,GeoWorldAD在NAVSIM v1和v2上展示了最先进的性能,突显了明确的三维几何基础和未来几何世界建模在安全高效自主驾驶中的有效性。
🔬 方法详解
问题定义:本文旨在解决自主驾驶中在动态三维环境下的安全规划问题。现有方法往往缺乏几何基础,导致在碰撞避免与行驶进度之间难以取得平衡。
核心思路:GeoWorldAD的核心思路是将轨迹规划与自我对齐的三维空间结合,并通过潜在的未来几何标记来预测短期场景的演变,从而提高决策的安全性与效率。
技术框架:GeoWorldAD的整体架构包括多个模块,首先是当前几何的获取,然后是潜在未来几何的预测,最后通过迭代轨迹优化来整合这些信息。
关键创新:GeoWorldAD的主要创新在于引入了未来几何的概念,使得模型能够在规划过程中考虑到周围环境的动态变化,从而减少过于保守的决策。
关键设计:在模型设计中,采用了多尺度的几何信息聚合策略,并通过特定的损失函数来优化轨迹的安全性与效率,确保模型在复杂环境中的表现。
🖼️ 关键图片
📊 实验亮点
在NAVSIM v1和v2的实验中,GeoWorldAD展示了最先进的性能,相较于基线方法,安全性与效率均有显著提升,具体性能数据表明其在复杂场景下的决策能力大幅提高,验证了几何基础与未来建模的有效性。
🎯 应用场景
GeoWorldAD的研究成果在自动驾驶领域具有广泛的应用潜力,能够提升车辆在复杂动态环境中的决策能力。其几何基础的轨迹规划方法不仅适用于自主驾驶,还可扩展至机器人导航、智能交通系统等领域,推动相关技术的发展与应用。
📄 摘要(原文)
Autonomous driving requires both safe and efficient planning decisions in dynamic 3D environments. Although recent Vision/Video-Action models learn policies directly from visual observations and scale well with advances in vision transformers and large-scale training data, they often lack explicit geometric grounding and future-aware spatial guidance, limiting their ability to balance collision avoidance and driving progress. In this work, we propose GeoWorldAD, a geometry world action model that grounds trajectory planning in ego-aligned 3D space and anticipates short-horizon scene evolution with latent future geometry tokens. Present geometry provides essential spatial constraints for safe planning, while future geometry reveals how surrounding agents and ego-centric free space may evolve, reducing overly conservative decisions without sacrificing safety. To efficiently exploit these geometric cues, GeoWorldAD progressively aggregates multi-scale present geometry and latent future geometry through iterative trajectory refinement. Experiments on NAVSIM v1 and v2 demonstrate state-of-the-art performance, highlighting the effectiveness of explicit 3D geometry grounding and future geometry world modeling for safe and efficient autonomous driving.