Visual Relocalization from Sparse Views in Aliased and Low-Texture Environments via Novel View Synthesis

📄 arXiv: 2607.22147v1 📥 PDF

作者: Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato

分类: cs.CV

发布日期: 2026-07-24

备注: Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

🔗 代码/项目: GITHUB


💡 一句话要点

提出一种新方法以解决低纹理环境中的视觉重定位问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉重定位 低纹理环境 3D高斯点云 多视图立体 激光雷达 相机姿态估计 几何监督

📋 核心要点

  1. 现有的视觉定位方法在低纹理和稀疏视角的环境中表现不佳,导致重定位精度下降。
  2. 本文提出了一种基于3D高斯点云的视觉重定位方法,直接估计相机姿态,避免了传统的对应关系匹配。
  3. 在行星类环境中进行的广泛实验验证了该方法的有效性,重定位精度显著提高。

📝 摘要(中文)

视觉定位在低纹理、感知别名、恶劣光照和稀疏视角的行星类地形中变得极具挑战性。在这些条件下,现有的图像到图像和图像到地图匹配方法性能显著下降。本文提出了一种视觉重定位方法,直接通过与3D高斯点云(3DGS)构建的可微分地图表示进行相机姿态估计。关键贡献在于提出了一种几何感知训练策略,结合了光度损失和几何损失,首次通过多视图立体(MVS)和激光雷达深度数据提供几何监督。实验表明,该方法在行星类环境中显著提高了重定位精度。

🔬 方法详解

问题定义:本文解决的是在低纹理和稀疏视角的行星类环境中进行视觉重定位的问题。现有方法在这些条件下性能显著下降,难以准确估计相机姿态。

核心思路:论文的核心思路是通过直接估计相机姿态而非依赖传统的对应关系匹配,利用3D高斯点云构建可微分地图表示,从而提高重定位的准确性和鲁棒性。

技术框架:整体架构包括数据采集、3D高斯点云构建、相机姿态估计和损失函数优化等主要模块。通过结合光度损失和几何损失,进行联合优化。

关键创新:最重要的技术创新在于提出了一种几何感知的训练策略,首次将多视图立体(MVS)和激光雷达深度数据结合用于几何监督,显著提升了模型对场景几何的适应性。

关键设计:在损失函数设计上,结合了光度损失和几何损失,以确保模型在光度和几何一致性上的优化。网络结构采用了适合处理稀疏视角数据的设计,增强了模型的鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的方法在行星类环境中的重定位精度相比于基线方法提高了显著的百分比,具体提升幅度未知。通过结合多视图立体和激光雷达深度数据,模型在光度和几何一致性上表现出更好的鲁棒性和准确性。

🎯 应用场景

该研究的潜在应用领域包括行星探测、自动驾驶和机器人导航等。在这些领域中,准确的视觉重定位能够显著提升系统的自主性和安全性,尤其是在复杂和未知的环境中。未来,该方法有望推动更广泛的应用,提升机器人在极端条件下的操作能力。

📄 摘要(原文)

Visual localization becomes extremely challenging in planetary-like terrains characterized by low texture, perceptual aliasing, harsh illumination, and sparse, weakly overlapping viewpoints induced by forward rover motion and unconstrained driving directions. Under these conditions, state-of-the-art image-to-image and image-to-map matching pipelines suffer significant performance degradation. In this work, we propose a visual relocalization method that departs from classical correspondence-based pipelines by directly estimating camera poses against a differentiable map representation built with 3D Gaussian Splatting (3DGS). Our key contribution is a geometry-aware training strategy that combines photometric and geometric losses, where the geometric supervision is provided for the first time by combining multi-view stereo (MVS) and LiDAR depths. We show that this joint optimization produces a 3DGS model that better fits the underlying scene geometry, leading to improved photometric and geometric consistency and more robust, accurate single-image 6-DoF pose estimation. Extensive experiments on data acquired in planetary-analog environments validate the effectiveness of our approach, showing substantial gains in relocalization accuracy under challenging conditions. Code is available at https://github.com/DLR-RM/multimodal-gsplat-relocalization.