WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
作者: Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song
分类: cs.CV, cs.AI
发布日期: 2026-07-09
备注: 20 pages, 7 figures
💡 一句话要点
提出WCog-VLA以解决现有自动驾驶模型的认知不足问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱四:生成式动作 (Generative Motion) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-行动 自动驾驶 世界认知 生成模型 博弈论推理 多代理轨迹 深度学习
📋 核心要点
- 现有的VLA模型在世界认知和预测方面存在不足,导致其只能进行反应式驾驶。
- WCog-VLA框架通过结合语义推理和生成模型,实现了主动驾驶的能力。
- 在NAVSIM基准测试中,WCog-VLA达到了92.9的PDMS得分,表现出色。
📝 摘要(中文)
视觉-语言-行动(VLA)模型在端到端自动驾驶中取得了进展。然而,现有方法要么缺乏全面的世界认知,要么在世界预测上存在碎片化,限制了模型的主动驾驶能力。为了解决这一局限性,本文提出了WCog-VLA,一个新颖的双层世界认知VLA框架,成功地将语义世界预测与生成世界演化结合,实现了主动的自动驾驶。在语义层面,WCog-VLA通过结合3D空间感知和注入代理令牌来捕捉世界动态,同时启用博弈论链式思维(Game-CoT)推理。在生成层面,我们引入了对齐解耦扩散变换器(ADDT),作为一个强大的生成世界模型,合成物理上合理的多代理轨迹。通过场景表示对齐,ADDT减少了去噪步骤,从而显著加速推理。大量实验表明,WCog-VLA在NAVSIM基准上达到了92.9的SOTA PDMS得分。
🔬 方法详解
问题定义:本文旨在解决现有视觉-语言-行动模型在世界认知和预测方面的不足,尤其是其反应式驾驶的局限性。现有方法往往无法全面理解和预测复杂的驾驶环境。
核心思路:WCog-VLA框架通过双层结构,将语义世界预测与生成世界演化相结合,提升了模型的主动驾驶能力。语义层面通过3D空间感知和博弈论推理增强认知,生成层面则利用生成模型合成合理的多代理轨迹。
技术框架:WCog-VLA的整体架构分为两个主要模块:语义层和生成层。语义层负责世界认知和推理,生成层则负责生成多代理的轨迹。通过对齐解耦扩散变换器(ADDT),实现了高效的推理过程。
关键创新:最重要的创新在于将语义推理与生成模型有效结合,特别是引入了博弈论链式思维(Game-CoT)推理,使得模型能够在复杂环境中进行更为有效的决策。
关键设计:在模型设计中,ADDT的对齐机制减少了去噪步骤,显著提高了推理速度。此外,构建了包含85k Game-CoT注释的大规模数据集,以支持模型的训练和评估。
🖼️ 关键图片
📊 实验亮点
在NAVSIM基准测试中,WCog-VLA达到了92.9的PDMS得分,显著优于现有方法,展示了其在主动驾驶任务中的卓越性能。这一结果表明,WCog-VLA在世界认知和预测方面的创新设计有效提升了模型的整体能力。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶汽车、智能交通系统和机器人导航等。通过提升模型的主动决策能力,WCog-VLA能够在复杂环境中更好地应对突发情况,提高行车安全性和效率。未来,该模型的设计理念也可能应用于其他需要复杂决策的智能系统中。
📄 摘要(原文)
Vision-Language-Action (VLA) models have advanced end-to-end autonomous driving. However, existing methods either lack comprehensive world cognition or suffer from fragmented world foresight, inherently confining these models to reactive driving. To address this limitation, we propose WCog-VLA, a novel dual-level World-Cognitive VLA framework that successfully bridges semantic world forecasting with generative world evolution to achieve proactive autonomous driving. At the semantic level, WCog-VLA unifies world cognition and reasoning by incorporating 3D spatial perception and injecting agent tokens to capture the world dynamics, while concurrently enabling Game-theoretic Chain-of-Thought (Game-CoT) reasoning. At the generative level, we introduce the Aligned Decoupled Diffusion Transformer (ADDT) as a powerful generative world model that synthesizes physically-plausible joint multi-agent trajectories. Through scene representation alignment, ADDT reduces the number of denoising steps required and thus significantly accelerates inference. To facilitate strategic reasoning, we further construct a large-scale dataset featuring 85k Game-CoT annotations. Extensive experiments on the NAVSIM benchmark demonstrate that WCog-VLA achieves a State-Of-The-Art (SOTA) PDMS score of 92.9.