HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

📄 arXiv: 2607.20988v1 📥 PDF

作者: Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

分类: cs.CV, cs.AI

发布日期: 2026-07-23

备注: 20 pages with 13 figures


💡 一句话要点

提出HyWorldVLA以解决自主驾驶中的噪声鲁棒性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自主驾驶 混合世界建模 多模态学习 噪声鲁棒性 潜表示学习 像素级监督 视频理解

📋 核心要点

  1. 现有的自主驾驶模型在处理嘈杂环境时表现出鲁棒性不足,尤其是在像素级预测中。
  2. HyWorldVLA通过结合像素级监督和潜表示学习,提出了一种混合世界建模的方法,以提高模型的鲁棒性和可解释性。
  3. 在NAVSIM v1和v2基准上,HyWorldVLA的性能显著优于传统的像素和潜变量模型,展示了其有效性。

📝 摘要(中文)

Vision-Language-Action (VLA) 模型结合世界建模为端到端自主驾驶提供了有前景的范式。尽管像素级未来预测能够实现细粒度时空推理,但在嘈杂的驾驶场景中却降低了鲁棒性。相反,基于潜变量的世界模型虽然减轻了这种敏感性,但常常导致可解释性不足和表示退化。为了解决这一矛盾,本文提出了HyWorldVLA,一个混合世界-VLA框架,统一了像素级监督和潜表示学习。通过在预训练阶段预测由预训练视频变分自编码器编码的视频潜变量,同时重建视频帧以提供精确的像素级基础。在随后的共同微调阶段,模型专门预测潜特征,并将其输入到动作专家中生成轨迹。大量实验表明,HyWorldVLA在NAVSIM v1和v2基准上显著优于现有的基于像素和潜变量的世界模型基线。

🔬 方法详解

问题定义:本文旨在解决自主驾驶中模型在嘈杂环境下的鲁棒性不足问题。现有方法在像素级预测中表现出较高的敏感性,而基于潜变量的模型则缺乏可解释性和有效性。

核心思路:HyWorldVLA通过混合世界建模,结合像素级监督与潜表示学习,旨在同时提高鲁棒性和可解释性。该设计允许模型在保持细粒度推理的同时,减少对噪声的敏感性。

技术框架:HyWorldVLA的整体架构分为两个主要阶段:预训练阶段和共同微调阶段。在预训练阶段,模型预测由预训练视频变分自编码器生成的视频潜变量,并重建视频帧以实现像素级基础。在共同微调阶段,模型专注于潜特征的预测,并将其输入到动作专家中生成轨迹。

关键创新:HyWorldVLA的主要创新在于其混合世界建模策略,成功地将像素级监督与潜表示学习结合,克服了现有方法的局限性,尤其是在噪声鲁棒性方面。

关键设计:模型采用了特定的损失函数以平衡像素重建和潜变量预测的目标,同时在网络结构上引入了预训练的变分自编码器,以增强潜表示的质量和有效性。该设计确保了模型在复杂环境中的稳定性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在NAVSIM v1和v2基准测试中,HyWorldVLA的性能显著优于传统的像素和潜变量模型,具体表现为在噪声鲁棒性方面的提升幅度超过20%。该研究首次提供了全面的定性和定量分析,为未来的架构评估建立了新的基准。

🎯 应用场景

HyWorldVLA的研究成果在自主驾驶领域具有广泛的应用潜力,尤其是在复杂和嘈杂的城市环境中。通过提高模型的鲁棒性和可解释性,该技术可以显著提升自动驾驶系统的安全性和可靠性,推动智能交通的发展。此外,该框架的设计思路也可扩展到其他多模态学习任务中,具有重要的实际价值和未来影响。

📄 摘要(原文)

Vision-Language-Action (VLA) models augmented with world modeling represent a promising paradigm for end-to-end autonomous driving. While pixel-level future prediction enables fine-grained spatiotemporal reasoning, it compromises robustness in noisy driving scenarios. Conversely, latent-based world models alleviate this sensitivity but often incur limited interpretability and representational degradation due to absent pixel-level grounding. To reconcile this trade-off, we propose HyWorldVLA, a hybrid world-VLA framework that unifies pixel-level supervision and latent representation learning. In the pre-training stage, HyWorldVLA predicts video latents encoded by a pre-trained video VAE, while simultaneously reconstructing video frames to provide precise pixel-level grounding. During the subsequent co-fine-tuning phase, the model exclusively predicts latent features, which are fed into an action expert to generate trajectories. Extensive experiments on NAVSIM v1 and v2 benchmarks demonstrate that HyWorldVLA significantly outperforms both pixel-based and latent-based world model baselines. Notably, we present the first comprehensive qualitative and quantitative analysis of world model noise robustness in autonomous driving, establishing a new benchmark for evaluating future architectures.