ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models

📄 arXiv: 2607.12959v1 📥 PDF

作者: Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Jing Li, Lu Zhang, Jiajun Deng, Yanyong Zhang

分类: cs.CV

发布日期: 2026-07-14


💡 一句话要点

提出ViCo3D以解决LiDAR基础的协作3D目标检测问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: LiDAR 协作检测 视觉基础模型 多模态融合 3D目标检测 车联网

📋 核心要点

  1. 现有的LiDAR基础的3D感知方法在特征融合上存在几何主导和语义缺乏的问题,限制了协作效果。
  2. ViCo3D通过将点云投影为三通道图像,结合DINOv2提取视觉特征,并引入多尺度融合模块和跨代理融合策略,提升了协作检测能力。
  3. 在DAIR-V2X和V2XSet数据集上的实验结果显示,ViCo3D达到了最先进的性能,并在DAIR-V2X上实现了1.8倍的协作增益。

📝 摘要(中文)

基于LiDAR的协作3D感知在车联网(V2X)系统中通常依赖于跨代理的鸟瞰图(BEV)特征融合。然而,现有的BEV表示通常由从头训练的LiDAR骨干网络提取,主要受几何特征主导,缺乏通用的语义先验,限制了特征级协作的有效性。为此,本文提出ViCo3D,一个基于视觉基础模型(VFM)的协作3D目标检测框架。ViCo3D通过将点云投影到BEV平面作为三通道图像,使DINOv2能够从LiDAR输入中提取BEV空间视觉特征,并引入多尺度BEV融合模块以有效整合这些特征与LiDAR几何特征。此外,ViCo3D采用自我中心的跨代理融合策略,从多个代理聚合互补信息。实验结果表明,ViCo3D在DAIR-V2X和V2XSet上实现了最先进的3D检测性能,特别是在DAIR-V2X上比之前的方法提升了1.8倍的协作增益。

🔬 方法详解

问题定义:本文旨在解决基于LiDAR的协作3D目标检测中的特征融合不足问题。现有方法主要依赖几何特征,缺乏有效的语义信息,导致协作效果不佳。

核心思路:ViCo3D通过将点云数据投影到BEV平面,利用视觉基础模型(VFM)提取更丰富的视觉特征,从而增强LiDAR数据的语义信息,提升协作检测的效果。

技术框架:ViCo3D的整体架构包括三个主要模块:首先,将LiDAR点云投影为三通道图像;其次,使用DINOv2提取BEV空间的视觉特征;最后,采用多尺度BEV融合模块和自我中心的跨代理融合策略来整合信息。

关键创新:ViCo3D的主要创新在于将视觉基础模型成功适配于LiDAR数据,克服了图像与点云之间的模态差异,显著提升了特征融合的效果。

关键设计:在设计中,ViCo3D引入了多尺度融合模块以增强特征的表达能力,并采用了特定的损失函数来优化融合效果,确保不同尺度特征的有效整合。整体网络结构经过精心设计,以适应LiDAR数据的特点。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,ViCo3D在DAIR-V2X和V2XSet数据集上实现了最先进的3D检测性能,特别是在DAIR-V2X上,协作增益达到了1.8倍,相较于之前的方法显著提升了检测效果。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、智能交通系统和机器人协作等。通过提升LiDAR基础的3D目标检测能力,ViCo3D能够在复杂环境中实现更高效的目标识别与跟踪,具有重要的实际价值和未来影响。

📄 摘要(原文)

LiDAR-based collaborative 3D perception in Vehicle-to-Everything (V2X) systems typically relies on fusing bird's-eye-view (BEV) features across agents. However, current BEV representations, typically extracted by LiDAR backbones trained from scratch, are geometry-dominated and lack general semantic priors, inherently limiting the efficacy of feature-level collaboration. Meanwhile, vision foundation models (VFMs) pretrained on large-scale image data have demonstrated strong capability in learning general-purpose and informative visual representations for 2D tasks, and have the potential to enhance agent-wise LiDAR BEV representations for collaboration. Despite this potential, adapting VFMs to LiDAR-based 3D detection remains challenging due to the substantial image-point cloud modality gap. To bridge this gap, we propose ViCo3D, a collaborative 3D object detection framework powered by VFMs. Specifically, ViCo3D adapts VFMs to LiDAR-based collaborative perception from three aspects: First, ViCo3D projects point clouds onto the BEV plane as three-channel images, enabling DINOv2 to extract BEV-space visual features from LiDAR inputs. Besides, to effectively integrate these DINOv2-derived features with LiDAR geometric features, ViCo3D introduces a multi-scale BEV fusion module within the single-agent encoder. In addition, ViCo3D adopts an ego-centric cross-agent fusion strategy to aggregate complementary information from multiple agents. Experiments on DAIR-V2X and V2XSet demonstrate that ViCo3D achieves state-of-the-art 3D detection performance. Remarkably, it delivers up to 1.8x greater collaborative gains than prior methods on DAIR-V2X. The code will be made public available for future investigation.