DXPR: Depth-Based Vision-LiDAR Cross-Modal Place Recognition Using Vision Foundation Models

📄 arXiv: 2609.09005v1 📥 PDF

作者: Yungsoo Han, Youngseok Jang, Seungwon Roh, Jeongyeon Seo, H. Jin Kim

分类: cs.CV

发布日期: 2026-09-08

备注: 8 pages, 6 figures, and 5 tables


💡 一句话要点

提出DXPR框架以解决多模态场景识别问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 跨模态识别 深度学习 视觉基础模型 LiDAR 机器人定位 自动驾驶 多模态融合

📋 核心要点

  1. 现有方法在多模态场所识别中面临季节、天气和光照变化的挑战,导致定位不稳定。
  2. DXPR框架通过将相机图像和LiDAR扫描转换为统一的深度图像表示,利用单一的视觉基础模型进行模态不变的全局描述符学习。
  3. 在KITTI数据集上,DXPR在大多数序列中实现了近乎完美的Recall@1,并在Boreas数据集上显示出明显的性能提升。

📝 摘要(中文)

我们提出了DXPR,一个基于深度的跨模态场所识别框架,利用视觉基础模型(VFM)将单目相机查询与LiDAR地图进行匹配,而无需特定模态的编码器。这使得机器人和自动驾驶车辆能够在预构建的LiDAR地图中,仅使用相机进行稳健定位,即使在严重的季节、天气和光照变化下。关键思想是将相机图像和LiDAR扫描转换为统一的深度图像表示,以便单一的VFM主干网络与聚合头可以学习模态不变的全局描述符。为了使成对度量学习忠实于场景几何,我们引入了几何感知重叠挖掘器:在相机和LiDAR深度的跨模态尺度对齐后,我们在视图之间前向扭曲测量,以计算像素级重叠分数。该分数重新标记模糊对并自适应调节多相似性损失中的正边距,以避免在弱重叠视图上过拟合。对KITTI和Boreas的广泛实验表明,在季节、天气和昼夜变化下,DXPR表现出强大的性能和鲁棒性。

🔬 方法详解

问题定义:本论文旨在解决多模态场所识别中的鲁棒性问题,尤其是在季节、天气和光照变化下,现有方法往往依赖于特定模态的编码器,导致性能下降。

核心思路:DXPR通过将相机图像和LiDAR扫描转换为统一的深度图像表示,利用单一的视觉基础模型进行模态不变的全局描述符学习,从而实现跨模态匹配。

技术框架:DXPR的整体架构包括深度图像转换模块、VFM主干网络和聚合头,以及几何感知重叠挖掘器。首先,将相机和LiDAR数据转换为深度图像,然后通过VFM进行特征提取,最后通过重叠挖掘器优化匹配过程。

关键创新:引入几何感知重叠挖掘器,通过前向扭曲测量计算像素级重叠分数,重新标记模糊对并自适应调节多相似性损失中的正边距,显著提高了模型在弱重叠视图上的鲁棒性。

关键设计:在损失函数设计上,采用多相似性损失以避免过拟合,同时在网络结构中使用VFM主干网络以实现模态不变性,确保了模型在不同环境下的稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在KITTI数据集上,DXPR在大多数序列中实现了近乎完美的Recall@1,显著优于先前的CMPR基线。在Boreas数据集上,DXPR在序列内性能上与强单模态基线(DINOv2-SALAD)相当,并在序列间设置中显示出明显的性能提升,展现出在多种季节和光照变化下的鲁棒性。

🎯 应用场景

DXPR框架具有广泛的应用潜力,特别是在机器人导航和自动驾驶领域。通过提高多模态场所识别的鲁棒性,该技术能够在复杂环境中实现更可靠的定位,进而推动智能交通系统和自主移动设备的发展。

📄 摘要(原文)

We present DXPR, a depth-based cross-modal place recognition (CMPR) framework that uses vision foundation models (VFMs) to match monocular camera queries against a LiDAR map without modality-specific encoders. This enables robots and autonomous vehicles to robustly localize using only cameras within pre-built LiDAR maps, even under severe seasonal, weather, and illumination changes. The key idea is to convert both camera images and LiDAR scans into a unified depth image representation so that a single VFM backbone with an aggregation head can learn modality-invariant global descriptors. To make pairwise metric learning faithful to scene geometry, we introduce a geometry-aware overlap miner: after cross-modal scale alignment of camera and LiDAR depth, we forward-warp measurements between views to compute a pixel-level overlap score. This score relabels ambiguous pairs and adaptively modulates the positive margin in a multi-similarity loss to avoid overfitting on weakly overlapping views. Extensive experiments on KITTI odometry and Boreas demonstrate strong performance and robustness across seasons, weather, and day/night. On KITTI, DXPR achieves near-perfect Recall@1 on most sequences and outperforms prior CMPR baselines. On Boreas, DXPR achieves intra-sequence performance on par with a strong single-modal baseline (DINOv2-SALAD), while showing clear improvements in the more challenging inter-sequence setting. Compared with RangeBEV, our method consistently performs better in both intra- and inter-sequence evaluations, demonstrating robustness under diverse seasonal and illumination changes.